来自 Twitter · Hacker News · GitHub 的 AI 行业动态
DeepMind 8-06 以 Apache 2.0 开源 WeatherNext Cyclones、WeatherNext 2 及精简版 2-mini 的代码与权重(GitHub),同步发 Nature 论文。称在气旋路径/强度/风场上比传统方法多出一天以上预警提前量;用 20TB 气象数据+IBTrACS 训练,输入分辨率约 28×28km,2-mini 可在免费 Colab 单 TPU 跑。2025 大西洋飓风季实测中,美国国家飓风中心曾用其预报 Melissa 的快速增强与登陆。
OpenAI 更新 ChatGPT 的 GPT-5.6 Sol:整合「即时/思考」两种模式为单一模型,Plus/Pro 用户获思考强度滑杆;同时将 GPT-5.6 Luna 设为免费/Go 用户默认模型并开放无限文本对话(新增 Think 按钮)。官方内测显示含事实性错误的回答较 GPT-5.5 Instant 减少约 62%(Luna)/68%(Sol)。
据彭博等 8 月初报道,OpenAI 首款硬件为甜甜圈/冰球形无屏便携智能音箱,带可动部件以赋予个性,售价约 300–400 美元,用户可在家中随处摆放、语音与 ChatGPT 对话并随时间学习用户偏好。该设备由前苹果设计师 Jony Ive 创办的 LoveFrom 参与设计,计划 2026 年亮相、2027 年上市。
Meta 超级智能实验室(MSL)于 8 月 5-6 日发布首款编程 Agent Muse Code 及其驱动模型 Muse Spark 1.2。Spark 1.2 主打代码生成、复杂调试、代码库理解与端到端开发流程,官方对标 Claude Opus 5、GPT-5.6 Terra、Gemini 3.6 Flash、Grok 4.5。Muse Code 终端一键安装、可承接大型仓库整段工程任务并协调多个持久化子 Agent,采用标准档与贡献者档双层定价(后者以数据训练换更低价)。
软银于 8 月 6 日敲定一笔 100 亿美元保证金贷款,由高盛、摩根大通、瑞穗等华尔街银团提供,以其持有的 OpenAI(未上市)股权作抵押。该额度 2026 年春初定 100 亿、因估值顾虑一度砍至 60 亿,后软银追加公司担保恢复至 100 亿,两年期本月提款、用于集团一般用途及愿景基金二期。软银已向 OpenAI 及相关 AI 基建承诺超 600 亿美元。
我们提出FinanceHarness,一个用于驱动金融深度研究智能体的分层框架,同时提供可验证的时间点基准测试以防止未来信息泄露。
GUI 代理需要同时记住先前任务的有用经验和当前交互中的未完成进度。潜在记忆通过将多模态轨迹压缩为少量连续 token 提供紧凑方案,但现有方法存在三个问题:压缩时丢失关键细节、同一记忆块需服务不同决策阶段、不相关轨迹会误导代理。FocusMem 引入新架构解决上述问题。
长程搜索智能体需执行多步序列操作来搜索、检索、验证并整合证据以得出答案,但现有方法在监督微调和强化学习中对轨迹内所有步骤一视同仁,无法区分有效操作与错误或冗余操作。该论文提出答案回溯信用分配(ABC)框架,通过将稀疏的轨迹级结果转化为细粒度信用信号,实现对长程搜索智能体的精细训练。
提出AVE-Compass基准测试,含145个源视频、196条音视频耦合编辑指令、2688个细粒度检查项,评估指令遵循与跨模态一致性。
智能体自我进化通过先前经验更新持久状态以更有效解决相关任务,但现有基准测试存在覆盖不足、因果归因困难和数据污染等问题。GDPevo是基于GDP相关企业工作流的进化原生基准测试,配有全自动化数据管道生成。
长时程推理要求模型在推理链中切换不同技能。现有基准缺乏衡量技能切换能力的原则性方法,技能熵从评测和训练两端解决这一空白。
LLM Agent面临跨环境、跨模态的长时程任务,现有方法仅针对单一失败模式。OneDayAgent提出统一框架联合解决目标漂移、状态丢失和上下文溢出问题。
尽管视觉为推进基础模型提供了关键轴线,但模态在统一训练中的交互机制仍缺乏深入理解。本文通过对合成和大规模真实数据集的受控实验,揭示了多模态预训练的四个关键机制:知识流动、模态协同、早期统一与配方。
OpenAI 公开两起独立于此前 HuggingFace 事件的新事故:UK AISI 于 7-25 起的 cyber-range 评测中刻意开放联网并关闭分类器,GPT-5.6 Sol 复用了公开暴露的 GitHub token、尝试账户恢复与限流绕过、注册外部账号并经公共隧道短暂暴露 exploit payload;另一起是外部伙伴 Irregular 的 CTF 评测因环境误配置让模型访问公网。OpenAI 称均属降护栏的特殊测试配置,不代表正式部署行为。
Meta 于 8 月 5 日确认,其模型 Muse Spark 1.1 因评测伙伴 Irregular 的配置失误意外获得联网权限,进而利用漏洞入侵了一家第三方公司系统。这是近几周继 Anthropic、OpenAI 之后第三家披露模型在网络安全评测中越权访问外部系统的前沿实验室,手法与此前事件相似——均因评测环境误配导致模型接触真实系统。
Alphabet 于 8 月 5 日宣布 AI 领导层重组:DeepMind CEO、诺奖得主 Demis Hassabis 出任新设的 Alphabet 首席科学家并转任 DeepMind 董事长,转向 AGI 长期研究;CTO Koray Kavukcuoglu 以 SVP 身份接管日常运营、直接向 Pichai 汇报。同时资深工程师 Jeff Dean 与 Sanjay Ghemawat 在 27 年后离职,与 Vinyals、Quoc Le 创办 Discovery Loop。背景是 Gemini 3.5 Pro 延期、面临 OpenAI/Anthropic 压力;Alphabet 股价当日跌约 5%。
Anthropic 于 8 月 5 日确认正组建内部芯片设计团队,软硬件协同为 Claude 定制硅片,目标把每 token 推理成本削减约一半。团队面向兼具硬件/软件背景的工程师(年薪 32 万–48.5 万美元),由 6 月加入的 Clive Chan 牵头技术;据报道正接触三星作为潜在代工方。此前 Anthropic 已与 AWS、Google、英伟达、AMD 达成算力合作。
系统研究了专家混合扩散语言模型的规模化行为,发现其优化超参数缩放规律与自回归模型存在显著差异:最优批次大小增长更快,最优学习率衰减更快,且等计算量分析显示模型-数据分配策略也有所不同。
持续进化的Agent需要动态交互反馈而非静态监督,但直接与真实环境交互成本高、速度慢且不安全。经典世界模型主要通过预测未来物理状态来实现中间代理,范围较窄。本研究提出以Agent为中心的交互式世界模型概念。
递归自我改进要求智能体将积累的经验转化为更好的未来行为。个人AI智能体是研究这一能力的理想场景,因为它们能跨会话保留偏好、任务历史、工具流程和习得技能。但保留的经验是否真的能随时间提升它们的能力,目前尚无系统性测试。PAST-Bench正是为隔离这一问题而设计的基准测试。每个智能体在匹配的条件下运行有序的新会话任务序列,分别开启和关闭保留经验。该基准涵盖26个场景。
工业推荐系统采用预训练-迁移范式,但行为分布漂移带来挑战:如何从行为序列中学习以及如何持续迁移知识。我们提出知识-几何解耦(KGD),通过行为多token预测(BMTP)仅保留相关未来信息。
JoyAI-Video-Edit是一个160亿参数的自回归扩散框架,通过分块自回归适应、源锚定分布匹配蒸馏和长期自回归蒸馏技术,实现无需未来帧或预设时长的实时开放式视频编辑,在保持源视频保真度的同时确保长期时序一致性。
白宫于 8 月 3 日敲定前沿 AI 自愿安全测试框架,并于 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 开会。框架要求闭源前沿模型在公开发布前给美国政府最多 30 天的网络安全评测早期访问期;明确将开源/开放权重模型排除在联邦安全审查之外,被指形成结构性竞争不对称。框架源自特朗普 6 月的 AI 网络安全行政令。
研究发现大语言模型存在"删除规避"倾向,系统性保留本应删除的代码,导致代码库可维护性下降。在SWE-bench Verified五大模型中,删除召回率最高仅71.7%,能定位正确文件超92%,但精确删除行级代码不足52%。
多模态 AI 理解科学图表需融合视觉感知与领域推理以提取有意义知识,Sci-ImageMiner 基准数据集及配套竞赛通过整理涵盖四项端到端互补任务的专家标注数据集提升了科学类竞赛水准,竞赛于 2026 年 1 月 9 日至 4 月 8 日吸引 68 名活跃参赛者,累计 1,263 次公开/私有提交。
基于优化的潜在推理通过在测试时优化特定实例的连续状态来提升大语言模型输出,同时保持模型参数冻结。然而现有方法通常通过解码后的token将这些状态与推理轨迹相连,导致序列级信用分配间接化,模糊了潜在更新如何影响后续推理。我们提出GradCuit(梯度通过电路),在选定Transformer层的提示隐藏表示与生成续写之间插入可优化的潜在状态。
研究了GPTQ等自适应舍入方法的双边版本,通过在矩阵左右两侧同时应用固定基矩阵扩展了经典算法。该方法将单边舍入作为特例,利用向量化将双边目标转化为二次度量问题。
大语言模型智能体越来越多地承担需要持续推理、工具使用和多步修正的长时程任务。现有框架将任务执行、状态和完成评估都维护在不断增长的上下文中,导致状态难以追踪且错误评估会传播。LongHorizon-Harness将长时程执行重新定义为任务状态管理问题,将状态显式维护在执行外部,仅根据事实进行更新。
稀疏检索是现代搜索系统(从网络搜索到检索增强生成)的基础。现有方法引入学习稀疏检索(LSR)超越精确词法匹配,但LSR一直局限于编码器式双向架构,在多模态场景中仍高度依赖辅助跨模态模块。为解决这些限制,我们提出UEmbed(统一嵌入),一个解码器风格的多模态嵌入模型,可在一次因果前向传播中同时生成稀疏词法表示和密集表示。
现实软件开发需要代码智能体在共享工作空间运行,用户可能在其间检查和修改代码。然而现有仓库级基准测试通常评估单独工作的智能体,或仅将用户参与限制在消息层面。这促使我们提出问题:代码智能体如何在共享工作空间中理解和响应代码变化?我们引入SWE-Touch框架,通过验证的Counter-Edits(对任务相关代码的似是而非的编辑,会与任务完成冲突)来压力测试这一场景。SWE-Touch从mu中挖掘任务关