来自 Twitter · Hacker News · GitHub 的 AI 行业动态
On-policy蒸馏通过沿student生成的轨迹查询teacher来适配扩散模型,但对无分类器引导(CFG)的处理仍不清楚。现有方法将速度匹配扩展到CFG组合预测,但这种目标在分支层面是欠定的——正负分支误差会相互补偿。
智能体搜索仅靠结果强化学习监督信号稀疏,从专有模型蒸馏知识时,传统 logit 匹配因隐藏 logits 和 tokenizer 不匹配而不可行,自然语言轨迹模仿效果有限。
现有音视频联合生成方法分别训练 VAE,导致潜在空间缺乏跨模态对齐,使下游生成模型需从头学习跨模态同步。OmniVAE 提出一种联合训练的音视频 VAE,实现跨模态对齐。
综述机器人学习中过程奖励的研究进展,涵盖不同观察、目标规范、输出信号和监督来源的方法差异与统一框架需求。
创意AI正从单步资产生成向长时程多模态创作演进。尽管近期生成模型能合成高质量图像、视频、音频、UI元素等创意资产,但实际创意工作远不止孤立的提示词-输出交互。它涉及参考资料、草稿、备选方案、编辑、失败尝试、版本关系、工具操作、评估信号和人类反馈,这些共同形成不断演进的项目状态。现有基于提示词、聊天和节点的生成系统仅能部分...
将具身智能数据组织为金字塔结构,整合真实机器人数据、UMI风格数据、模拟数据和通用视觉语言数据,平衡可扩展性与机器人对齐。
可视化HTML/Markdown编辑器,支持Google Doc式留评和AI agent反馈。兼容主流AI harness。
因公开分享页面缺少 noindex 标签,Anthropic Claude 的数百个分享对话与 Artifacts 被 Google/Bing 索引,含简历、财务、医疗记录乃至加密钱包助记词等敏感信息,7 月 25 日经 Reddit 用户发现,Fortune/Axios 等报道。Google 于 7 月 26 日移除相关结果,Anthropic 修补后称一贯不向搜索引擎提供对话目录。
据路透独家,中国已开始小批量量产国产浸没式 DUV 光刻机,由国资背景的上海爱晟纳整合多家光刻初创团队牵头,计划 2026 年交付约 5 台、2027 年约 20 台,首批交 SMIC/华虹/长鑫做产线验证。机型面向 28nm 单次曝光(多重曝光理论可达 7/5nm,但良率低成本高),部分关键部件仍依赖日本供应商,整体性能落后 ASML。
英伟达 7 月 27 日宣布向 Ilya Sutskever 的 Safe Superintelligence(SSI)投资约 50 亿美元并结成长期战略合作,SSI 将获下一代 Vera Rubin 平台、算力提升约一个数量级,双方共同推进算力平台技术演进。SSI 成立于 2024 年,目标只做「安全超级智能」一个产品。
据《华尔街日报》等报道,英伟达正洽谈为 OpenAI 提供约 2500 亿美元融资担保,使其可租用软银 SB Energy 在俄亥俄建设的 10 吉瓦数据中心;连同芯片采购另一笔或达 3500 亿美元,全项目含芯片或超 5000 亿美元,为迄今最大数据中心项目。条款未定、或告吹。
Dario Amodei 发文正式阐明 Anthropic 对开放权重模型的立场:明确否认曾主张禁开源,称不具危险能力的开源模型是公共产品;但认为保护主义禁令解决不了国安担忧,主张三项措施——对华管制强芯片并打击走私、打击工业级蒸馏、对所有足够强大的模型(无论开源闭源)强制发布前安全测试。此前 Anthropic 与 OpenAI 均未签署 50 家公司联署的开放权重公开信。
工业视频异常检测用于识别工业流程中的异常事件,现有视觉语言模型方法在面对复杂物体变换、严格物理约束和工艺流程限制时性能下降。研究团队提出一种免训练的智能框架,以应对工业场景中的交互密集型检测任务。
月之暗面发布旗舰 Kimi K3 并开放权重:2.8 万亿参数 MoE(896 专家、每 token 激活 16 个、约 50B 激活参数)、原生多模态、100 万 token 上下文,为迄今参数最大的开源权重模型(MXFP4 四比特约 1.4TB)。同步开源配套栈:MoonEP(分布式 MoE 高性能通信库)、AgentENV(大规模智能体环境,服务 agentic RL)、FlashKDA(基于 CUTLASS 的 Kimi Delta Attention 内核,H20 prefill 最高约 2.22x)。
NVIDIA与Linux基金会牵头成立Open Secure AI Alliance,27+创始成员含微软、IBM、红帽、Hugging Face、CrowdStrike、Cloudflare、SpaceX、戴尔、Salesforce等40余家机构,开放共享用于保护AI智能体、软件及基础设施的安全技术;此举正值Hugging Face遭黑客攻击之后(Meta未在名单中)。
扩散模型在迭代采样中通常受误差累积影响,即曝光偏差。研究揭示了训练与推理间存在系统性的频率相关差异,可理解为频率相关信噪比误差。该失配方向随模型和时间步不同而变化,表明固定校正规则无法泛化。团队提出频谱对齐(SPA),一种轻量级、基于引导的方法,将中间预测的功率谱校准至预计算的先验分布。该方法包含两个阶段。
大语言模型作为智能体时,仅靠next-token预测难以实现可靠决策。该研究提出多头潜在控制机制,使模型能在推理时自主决定继续推理、调用更强模型、请求信息或调用工具。现有方法依赖输入侧路由,成本高且难维护。
代理强化学习涉及持续的算法修改、新估算器、新管道阶段和rollout方案,在主流框架中每次改动都需贯穿trainer、分布式后端和rollout胶水层,成本由研究者承担。Molt是PyTorch原生训练框架,代码库紧凑清晰,研究者可全局掌握,AI助手可完整读取推理,实现端到端算法流程追踪和修改。
一个开源图工程运行时,将编排逻辑保留在TypeScript中,并将语义工作委托给可替换的Agent运行时。
该项目可将ChatGPT Web(包括Pro版)集成到Codex应用中,支持上下文对话、工具调用、流式输出和图片功能,且不受Codex使用限制。
据彭博 Mark Gurman 报道,苹果将智能眼镜(代号 N50)发布推迟,亮相预计移至 2027 年 WWDC,部分因重大隐私顾虑。团队将隐私列为首要,倾向端侧处理、不做人脸识别、录制不进 AI 训练,甚至考虑无摄像头版本,以避免 Meta 智能眼镜遭遇的隐私反弹。
任意运行,随处可用
Sakana AI 推出多智能体编排模型 Fugu 的 Claude Code 接口,可在 Claude Code 工作流中调度 Claude/Gemini/GPT 等前沿模型协同写码调试执行;同期 Fugu-Ultra v1.1 在 ProgramBench、Terminal Bench 2.1 上进一步提升,终端任务超过 Claude Fable 5 与 GPT-5.5。
vLLM v0.26.0 发布,含 411 次提交(212 位贡献者):新增 Inkling 模型族全栈支持、DeepSeek-V4 专用路由内核与 fused topK(1.5–2x 提速)、分层 KV 卸载与对象存储分级、Rust 前端扩展(多模态音视频/工具解析)及 Transformers 5.13.0 集成。
NAVER、Brookfield与NVIDIA宣布100亿美元合作(Brookfield出资至多90亿、NVIDIA投资10亿、NAVER补足余额),将位于世宗GAK数据中心的NVIDIA DSX AI工厂从55兆瓦扩至200兆瓦,2028年完工,为韩美AI开发者提供产能级算力。
SK集团与NVIDIA签署意向书,宣布超5000亿美元AI基础设施合作:SK电讯将在韩国建设2吉瓦Vera Rubin DSX AI工厂(首座2027年上线),SK海力士与NVIDIA长期共研下一代AI存储(含HBM)。
开源桌面 AI 代理,支持工具、文件、知识、工作流及实际交付物。
追踪编程Agent执行详情与成本消耗,分解任务为工作步骤(工具使用、文件变更、测试运行、时间与token消耗)。支持Claude Code、Codex、OpenCode等平台,无需登录、无遥测。
Black Forest Labs 发布 FLUX 3,单一流匹配架构联合处理图像/视频/音频并可扩展预测机器人动作,一次推理生成最长 20 秒带原生同步音轨的视频。首次进入具身智能(robotics variant 已在奥迪产线试用)。Video/Action 目前限量早期访问,尚无公开 API 与定价,Image 版本计划随后放出。
具身视觉追踪(EVT)要求移动智能体仅通过机载视觉持续跟随自然语言描述的目标。ReferTrack 提出一种指代-追踪范式,使用单个前向摄像头实现具身追踪,先从图像中选取目标。