全部 今日 本周 本月

Google DeepMind 开源 WeatherNext 气旋预报模型:代码+权重+Nature 论文

DeepMind 8-06 以 Apache 2.0 开源 WeatherNext Cyclones、WeatherNext 2 及精简版 2-mini 的代码与权重(GitHub),同步发 Nature 论文。称在气旋路径/强度/风场上比传统方法多出一天以上预警提前量;用 20TB 气象数据+IBTrACS 训练,输入分辨率约 28×28km,2-mini 可在免费 Colab 单 TPU 跑。2025 大西洋飓风季实测中,美国国家飓风中心曾用其预报 Melissa 的快速增强与登陆。

研究 AI 摘要 · 单一来源
@GoogleDeepMind 阅读 →

OpenAI 升级 GPT-5.6 Sol,并向免费用户开放 GPT-5.6 Luna

OpenAI 更新 ChatGPT 的 GPT-5.6 Sol:整合「即时/思考」两种模式为单一模型,Plus/Pro 用户获思考强度滑杆;同时将 GPT-5.6 Luna 设为免费/Go 用户默认模型并开放无限文本对话(新增 Think 按钮)。官方内测显示含事实性错误的回答较 GPT-5.5 Instant 减少约 62%(Luna)/68%(Sol)。

产品发布 AI 摘要 · 单一来源
@OpenAI 阅读 →

OpenAI 首款硬件曝光:甜甜圈形无屏智能音箱,售价 300–400 美元

据彭博等 8 月初报道,OpenAI 首款硬件为甜甜圈/冰球形无屏便携智能音箱,带可动部件以赋予个性,售价约 300–400 美元,用户可在家中随处摆放、语音与 ChatGPT 对话并随时间学习用户偏好。该设备由前苹果设计师 Jony Ive 创办的 LoveFrom 参与设计,计划 2026 年亮相、2027 年上市。

硬件 AI 摘要 · 单一来源
彭博(据报道) 阅读 →

Meta 发布 Muse Code 编程 Agent 与 Muse Spark 1.2

Meta 超级智能实验室(MSL)于 8 月 5-6 日发布首款编程 Agent Muse Code 及其驱动模型 Muse Spark 1.2。Spark 1.2 主打代码生成、复杂调试、代码库理解与端到端开发流程,官方对标 Claude Opus 5、GPT-5.6 Terra、Gemini 3.6 Flash、Grok 4.5。Muse Code 终端一键安装、可承接大型仓库整段工程任务并协调多个持久化子 Agent,采用标准档与贡献者档双层定价(后者以数据训练换更低价)。

产品发布 AI 摘要 · 单一来源
@Meta 阅读 →

软银以 OpenAI 股权为抵押获 100 亿美元 margin loan

软银于 8 月 6 日敲定一笔 100 亿美元保证金贷款,由高盛、摩根大通、瑞穗等华尔街银团提供,以其持有的 OpenAI(未上市)股权作抵押。该额度 2026 年春初定 100 亿、因估值顾虑一度砍至 60 亿,后软银追加公司担保恢复至 100 亿,两年期本月提款、用于集团一般用途及愿景基金二期。软银已向 OpenAI 及相关 AI 基建承诺超 600 亿美元。

融资 AI 摘要 · 单一来源
彭博(据报道) 阅读 →

FinanceHarness:自主式金融深度研究框架

我们提出FinanceHarness,一个用于驱动金融深度研究智能体的分层框架,同时提供可验证的时间点基准测试以防止未来信息泄露。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

FocusMem:分解 GUI 潜在记忆中的内容、读取与信任机制

GUI 代理需要同时记住先前任务的有用经验和当前交互中的未完成进度。潜在记忆通过将多模态轨迹压缩为少量连续 token 提供紧凑方案,但现有方法存在三个问题:压缩时丢失关键细节、同一记忆块需服务不同决策阶段、不相关轨迹会误导代理。FocusMem 引入新架构解决上述问题。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

ABSeeker:基于答案回溯信用分配的長程搜索智能体训练方法

长程搜索智能体需执行多步序列操作来搜索、检索、验证并整合证据以得出答案,但现有方法在监督微调和强化学习中对轨迹内所有步骤一视同仁,无法区分有效操作与错误或冗余操作。该论文提出答案回溯信用分配(ABC)框架,通过将稀疏的轨迹级结果转化为细粒度信用信号,实现对长程搜索智能体的精细训练。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

AVE-Compass:音视频编辑能力综合评估基准

提出AVE-Compass基准测试,含145个源视频、196条音视频耦合编辑指令、2688个细粒度检查项,评估指令遵循与跨模态一致性。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

GDPevo:基于真实商业任务评估智能体自我进化

智能体自我进化通过先前经验更新持久状态以更有效解决相关任务,但现有基准测试存在覆盖不足、因果归因困难和数据污染等问题。GDPevo是基于GDP相关企业工作流的进化原生基准测试,配有全自动化数据管道生成。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

面向技能原生LLM:技能熵用于长时程推理评测与训练

长时程推理要求模型在推理链中切换不同技能。现有基准缺乏衡量技能切换能力的原则性方法,技能熵从评测和训练两端解决这一空白。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

OneDayAgent:面向长时程自主Agent的通用框架

LLM Agent面临跨环境、跨模态的长时程任务,现有方法仅针对单一失败模式。OneDayAgent提出统一框架联合解决目标漂移、状态丢失和上下文溢出问题。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

迈向多模态预训练的物理学:知识流动、模态协同、早期统一与配方

尽管视觉为推进基础模型提供了关键轴线,但模态在统一训练中的交互机制仍缺乏深入理解。本文通过对合成和大规模真实数据集的受控实验,揭示了多模态预训练的四个关键机制:知识流动、模态协同、早期统一与配方。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →