来自 Twitter · Hacker News · GitHub 的 AI 行业动态
DeepMind 8-06 以 Apache 2.0 开源 WeatherNext Cyclones、WeatherNext 2 及精简版 2-mini 的代码与权重(GitHub),同步发 Nature 论文。称在气旋路径/强度/风场上比传统方法多出一天以上预警提前量;用 20TB 气象数据+IBTrACS 训练,输入分辨率约 28×28km,2-mini 可在免费 Colab 单 TPU 跑。2025 大西洋飓风季实测中,美国国家飓风中心曾用其预报 Melissa 的快速增强与登陆。
OpenAI 更新 ChatGPT 的 GPT-5.6 Sol:整合「即时/思考」两种模式为单一模型,Plus/Pro 用户获思考强度滑杆;同时将 GPT-5.6 Luna 设为免费/Go 用户默认模型并开放无限文本对话(新增 Think 按钮)。官方内测显示含事实性错误的回答较 GPT-5.5 Instant 减少约 62%(Luna)/68%(Sol)。
据彭博等 8 月初报道,OpenAI 首款硬件为甜甜圈/冰球形无屏便携智能音箱,带可动部件以赋予个性,售价约 300–400 美元,用户可在家中随处摆放、语音与 ChatGPT 对话并随时间学习用户偏好。该设备由前苹果设计师 Jony Ive 创办的 LoveFrom 参与设计,计划 2026 年亮相、2027 年上市。
Meta 超级智能实验室(MSL)于 8 月 5-6 日发布首款编程 Agent Muse Code 及其驱动模型 Muse Spark 1.2。Spark 1.2 主打代码生成、复杂调试、代码库理解与端到端开发流程,官方对标 Claude Opus 5、GPT-5.6 Terra、Gemini 3.6 Flash、Grok 4.5。Muse Code 终端一键安装、可承接大型仓库整段工程任务并协调多个持久化子 Agent,采用标准档与贡献者档双层定价(后者以数据训练换更低价)。
软银于 8 月 6 日敲定一笔 100 亿美元保证金贷款,由高盛、摩根大通、瑞穗等华尔街银团提供,以其持有的 OpenAI(未上市)股权作抵押。该额度 2026 年春初定 100 亿、因估值顾虑一度砍至 60 亿,后软银追加公司担保恢复至 100 亿,两年期本月提款、用于集团一般用途及愿景基金二期。软银已向 OpenAI 及相关 AI 基建承诺超 600 亿美元。
我们提出FinanceHarness,一个用于驱动金融深度研究智能体的分层框架,同时提供可验证的时间点基准测试以防止未来信息泄露。
GUI 代理需要同时记住先前任务的有用经验和当前交互中的未完成进度。潜在记忆通过将多模态轨迹压缩为少量连续 token 提供紧凑方案,但现有方法存在三个问题:压缩时丢失关键细节、同一记忆块需服务不同决策阶段、不相关轨迹会误导代理。FocusMem 引入新架构解决上述问题。
长程搜索智能体需执行多步序列操作来搜索、检索、验证并整合证据以得出答案,但现有方法在监督微调和强化学习中对轨迹内所有步骤一视同仁,无法区分有效操作与错误或冗余操作。该论文提出答案回溯信用分配(ABC)框架,通过将稀疏的轨迹级结果转化为细粒度信用信号,实现对长程搜索智能体的精细训练。
提出AVE-Compass基准测试,含145个源视频、196条音视频耦合编辑指令、2688个细粒度检查项,评估指令遵循与跨模态一致性。
智能体自我进化通过先前经验更新持久状态以更有效解决相关任务,但现有基准测试存在覆盖不足、因果归因困难和数据污染等问题。GDPevo是基于GDP相关企业工作流的进化原生基准测试,配有全自动化数据管道生成。
长时程推理要求模型在推理链中切换不同技能。现有基准缺乏衡量技能切换能力的原则性方法,技能熵从评测和训练两端解决这一空白。
LLM Agent面临跨环境、跨模态的长时程任务,现有方法仅针对单一失败模式。OneDayAgent提出统一框架联合解决目标漂移、状态丢失和上下文溢出问题。
尽管视觉为推进基础模型提供了关键轴线,但模态在统一训练中的交互机制仍缺乏深入理解。本文通过对合成和大规模真实数据集的受控实验,揭示了多模态预训练的四个关键机制:知识流动、模态协同、早期统一与配方。