全部 今日 本周 本月

弱到强在线策略蒸馏

在线策略蒸馏(OPD)通过让学生模型在自己的 rollout 上匹配教师的 token 级分布来迁移 LLM 能力。当前沿没有更强教师时,现有方法失效。我们提出弱到强在线策略蒸馏(W2S-OPD),一种无需更强教师即可有效蒸馏的简单方法。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Meta GEM 训练:如何在 LLM 规模下将广告基础模型效率翻倍

Meta 的生成式广告推荐模型 GEM(Facebook 与 Instagram 广告推荐底层模型)如今在最新 GPU 集群上以 LLM 规模训练,端到端训练效率提升一倍,模型 FLOPs 利用率达 20–25%,训练算力扩大 4 倍。

芯片 AI 摘要 · 单一来源
Meta Engineering Blog 阅读 →

SAF-OPD:一种用于在线策略蒸馏的稳定优势融合方法

具有可验证奖励的强化学习(RLVR)向每个token广播单一的回答级奖励,而在线策略蒸馏(OPD)针对更强的教师模型对每个token进行评分以获得密集优势,但将性能上限限制在教师水平且不鼓励超出该水平的探索。它们的互补性使结合RLVR和OPD很有前景,但我们发现用固定系数融合两种优势会因两种校准错误而导致熵崩溃:一是幅度不匹配,即token级OPD优势可能飙升远超有界的RLVR优势并抹去其信号,

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时扩展

尽管视觉-语言-动作(VLA)模型展现出令人印象深刻的视觉运动能力,但其在困难和分布外任务上的性能往往会下降。现有测试时引导和缩放方法虽能无需大量数据收集和重训练即提升性能,但动作样本仍集中于相似行为,继承了相关的失败模式。此外,现有方法在每个时间步都采用相同的干预策略,未考虑基础策略是否可能已成功。为解决这些局限,研究者提出了RL^2-VLA。

机器人 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

从RLVR到RLSVR:任务转换诱导开放式大语言模型自改进的可自验证奖励

可验证奖励强化学习(RLVR)通过大规模优化推动了推理导向大语言模型(LLM)的近期进展,但其适用性仍主要局限于数学和编码等可确定性验证的领域。开放式任务通常依赖人类偏好、奖励模型或LLM评判,存在评估偏差、评判能力瓶颈和额外推理成本等问题。本文借鉴自监督学习原则,通过构建前置任务来引导模型学习。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

N_0-VTLA:基于隐式触觉 token 扩展视觉-触觉-语言-动作模型

提出 N_0-VTLA,一种视觉-触觉-语言-动作(VTLA)基础模型,支持(1)基于触觉感知的精细接触操作与触觉反馈控制,(2)利用部署数据离线改进策略。该方法通过视觉-触觉预训练、分阶段触觉路径整合和优势条件离线策略改进实现。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

QQWorld:用于世界模型正则化的分位数-分位数匹配

潜在世界模型通过在紧凑表示空间预测未来状态实现高效规划,但性能高度依赖潜在分布质量。现有方法 LeWorldModel 使用 Epps-Pulley(EP)目标将潜在变量正则化为各向同性高斯分布,但 EP 的校正梯度对孤立尾部样本迅速消失,导致重尾偏差控制不足。QQWorld 用分位数-分位数匹配目标替代 EP,直接对齐投影分布的分位数。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

AISPA:面向大语言模型应用的用户中心化系统提示词审计框架

系统提示词是开发者配置的指令,用于控制AI应用中基础模型的行为。虽然广泛应用于商业AI产品,但很少向公众或监管机构公开,导致AI系统广泛部署中存在严重的信任和问责缺口。本文提出人工智能系统提示词保障(AISPA),一个用户中心化的框架,用于系统性审计AI系统中的系统提示词,检查具体部分并从8个对用户重要的维度进行评估。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

0xwilliamortiz/ratchet:你的agent读取规则,并验证其执行情况

你的agent读取规则,并验证其执行情况。

产品发布 AI 摘要 · 单一来源
GitHub Trending 阅读 →

彭博:Moonshot 经阿里巴巴使用约 2 万颗英伟达芯片训练 Kimi

据彭博 7 月 31 日报道,月之暗面(Moonshot)与阿里巴巴达成算力协议,通过阿里云使用约 2 万颗英伟达 GPU 集群训练并运行其 Kimi 模型(Kimi K3 于 7 月 17 日发布,称迄今最大开源系统)。阿里持有 Moonshot 约 36% 股份并提供云基础设施。公司估值攀升至约 350 亿美元、IPO 在望。此事处于美国对华芯片出口管制的敏感背景下——白宫官员此前曾指其获取受限英伟达芯片。

芯片 AI 摘要 · 单一来源
彭博(据报道) 阅读 →

See2Think:多模态模型是否真正使用了中间视觉状态?

多模态大语言模型在推理过程中越来越多地使用草图、注释、工具和中间图像,但目前尚不清楚它们是否真正依赖这些视觉状态。现有基准测试受限于任务覆盖范围窄或部分文本可解决的样本,以及仅强调最终答案而缺乏对中间视觉状态生成、渲染和使用过程诊断的评估。研究团队提出 See2Think 统一评估框架,包含 See2ThinkBench 和 Visual Action-of-Thought(VAoT),后者包含

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

字节 Seedance 2.5 登陆即梦/Dreamina:原生 30 秒视频

字节跳动 Seedance 2.5 视频模型于 7 月 31 日在即梦(Dreamina)平台上线。相比 Seedance 2.0 单次最长 15 秒,2.5 单次生成可达原生连贯 30 秒(非两段拼接)、最长约 3 分钟,此前已在企业版全球公测。模型于 6 月 23 日火山引擎 FORCE 大会发布,此番面向消费者平台开放。

产品发布 AI 摘要 · 单一来源
@dreamina_ai 阅读 →

MiniMax 发布 H3 视频模型,计划开源权重

MiniMax 于 7 月 31 日发布 H3 多模态视频生成模型,可综合文本/图像/视频/音频输入,默认生成最长约 15 秒、2K 分辨率、原生立体声视频,支持视频编辑、动作迁移与 Omni 多参考;主打广告/电商/产品设计/游戏等商用场景,官方称 2K 视频成本不到主流竞品的三分之一,并计划数日内开源模型权重——把开放权重路线延伸到此前多为闭源的视频生成领域。

大模型 AI 摘要 · 单一来源
@MiniMax_AI 阅读 →

ShadowDancer:通过从视频及影子学习统一动态表示实现视频世界模型任意动作控制

本文提出ShadowDancer,一种实现视频世界模型任意动作、帧级控制的新方法。其障碍在于表示层面:现有接口要么对动作进行松散编码,将展开方式留给模型即兴发挥;要么通过结构化信号精确编码,但仅适用于某一类动作且难以获取,跨不同动态的精确控制仍不切实际。演示视频是天然解决方案,可逐帧指定任意动态;但视频仅通过一种特定外观呈现动态,即潜在动力学的一个影子。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

DeepSeek 发布 DeepSeek-V4-Flash(公测)

DeepSeek 于 7 月 31 日正式发布 DeepSeek-V4-Flash 并开放 API 公测,模型权重已上线 HuggingFace。官方称其 Agent 能力显著增强、基准表现大幅超越此前的 V4-Pro-Preview;API 调用方式不变,将模型名设为 deepseek-v4-flash 即可使用最新版。此前 V4 预览版于 4 月 24 日发布。

大模型 AI 摘要 · 单一来源
@deepseek_ai 阅读 →

SK 海力士涨 25%、三星涨超 20%,AI 芯片行情回暖

7 月 31 日韩国芯片股大涨,SK 海力士涨 25.42%、三星电子涨 20.53%,带动 Kospi 创单日纪录涨幅。此前受亚马逊、微软亮眼财报重燃 AI 投资乐观情绪、美国费城半导体 ETF(SOXX)隔夜涨超 8% 推动;SK 集团会长崔泰源首次公开市场增持 SK 海力士、外资净买入超 3 万亿韩元亦助推。两只个股此前三个交易日曾分别跌 18.5%/27%。

芯片 AI 摘要 · 单一来源
CNBC 阅读 →

INTACT:用于无搜索世界模型的同构意图-动作学习

传统前向隐世界模型需通过昂贵的测试时搜索才能恢复动作。INTACT 提出端到端 JEPA,将动作标注的轨迹转化为可部署的意图-动作接口,通过同构架构和共享参数实现从物理意图到部署意图的直接映射。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

大语言模型能否执行父单拆分?

父单执行是算法交易核心问题,目标是将大单拆分为小单以降低执行成本。本文首次系统研究LLM在父单执行中的应用,提出分层规划框架PACE,将LLM在金融领域的应用从"交易什么"扩展到"如何执行"。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

MPIE-Bench:多人生物学合理交互编辑基准

文本生成图像和个性化编辑模型在单人图像上表现出色,但在多人接触动作(拥抱、搬运、扭打)中出现肢体融合、凭空生成和物体穿插等严重问题。MPIE-Bench包含2500个样本、405个场景和14种交互类别的基准测试。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

BM25在大规模场景中胜出:检索增强生成范式的规模化研究

检索增强生成涵盖词级和密集检索、图索引和代理搜索,但各范式通常在不同基准和单一语料库规模下评估,导致准确性-成本扩展性不明确。本研究沿28个严格嵌套层级变化语料库规模(约450倍范围),同时固定问题和相关及对抗文档,测量准确性、令牌消耗和延迟。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Flux-OPD:随学生表现演化的上下文的首要策略蒸馏

大语言模型在开放式领域训练中缺乏可验证奖励,任务偏好难以形式化为有效监督。上下文虽能传达偏好,但蒸馏到学生模型后额外监督有限,需随学生表现演化的上下文。然而直接使用演化上下文会导致蒸馏目标不稳定和分布冲突。本文通过分解分析上下文的效果。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

AskChem:面向化学文献综合的声明中心基础设施

化学文献综合通常需要整合分散在多篇文献中的具体发现。AskChem改变了检索单元,从论文转变为携带溯源信息的声明,便于跨论文搜索和验证。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Pan-Chera/Multi-Agent-CAD:MAC——通过约束测试时计算实现文本转CAD的解耦多智能体框架

MAC是一个解耦的多智能体框架,通过约束测试时计算实现文本到CAD生成。

产品发布 AI 摘要 · 单一来源
GitHub Trending 阅读 →

合成用户创业公司 Simile 完成 2 亿美元 B 轮、估值 20 亿

为营销与产品研究提供“合成用户/数字孪生”的 Simile 完成 2 亿美元 B 轮、估值 20 亿美元,Greenoaks 领投,距 2 月 Index 领投的 1 亿美元 A 轮仅五个月。创始人为斯坦福博士 Joon Sung Park(“Smallville”生成式 Agent 小镇作者)。自 2 月推出营收增长 5 倍,团队扩至 50+ 人,客户含 CVS Health、Deloitte、Gallup 等,用 AI 预测人类行为。

融资 AI 摘要 · 单一来源
@TechCrunch 阅读 →

欧盟拟出资最高 100 亿欧元建 7 座 AI 超级工厂

欧盟委员会 7 月 30 日宣布,将以最高 100 亿欧元(约 114 亿美元)公共资金资助建设 7 座 AI 超级工厂(gigafactories),以缩小与美中的算力差距,并期望撬动至少 200 亿欧元私人投资。每座预计配备至少 10 万颗先进 AI 芯片、算力约为欧盟现有数据中心的 4 倍,首批计划 2028 年年中投运。企业现可竞标。主席冯德莱恩称此为“构建技术主权”。

行业 AI 摘要 · 单一来源
欧盟委员会(@vonderleyen) 阅读 →

亚马逊 2026 资本开支上调至约 2200 亿美元

亚马逊 Q2 财报后将 2026 年资本开支预期上调约 200 亿至约 2200 亿美元(2 月为 2000 亿、去年全年 1280 亿),主要投向数据中心、芯片等 AI 基础设施,CEO Jassy 称主因是内存芯片涨价。AWS 营收同比增 37% 至 422 亿美元、为 18 个季度最快;股价盘后涨超 8%。Jassy 称即便如此产能仍不足以满足需求。

芯片 AI 摘要 · 单一来源
CNBC(亚马逊财报) 阅读 →

Thinking Machines 开源发布 Inkling-Small(276B/12B MoE)

Mira Murati 创办的 Thinking Machines 于 7 月 30 日开源发布 Inkling-Small:276B 总参数、12B 激活的 MoE 模型,性能接近旗舰 Inkling 但体量仅四分之一,支持音频/图像原生推理、可变思考力度与最长 100 万 token 上下文,面向 agentic、工具调用、编码助手与 RAG。全量权重开放,可在 Tinker 上微调。这是该实验室首个前沿规模模型。

大模型 AI 摘要 · 单一来源
@thinkymachines 阅读 →