全部 今日 本周 本月

Play2Perfect:灵巧玩耍预训练对精确装配重要的是什么?

名为Play2Perfect的强化学习框架通过先学习多样物体的通用操作技能,再微调适配精确装配任务,实现样本高效的机器人装配。

机器人 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

GEAR:用于图像合成的引导式端到端自回归模型

GEAR通过表示对齐联合训练向量量化分词器和自回归生成器,采用双读出方法克服不可微分问题,提升收敛速度和特征质量。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

PolyFlow:面向艺术家风格网格生成的连续拓扑嵌入流匹配

PolyFlow 引入使用拓扑嵌入器的连续网格表示,并用流匹配和 Transformer 实现并行网格生成,相比自回归方法推理更快、分辨率控制更精确。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

我们在测量策略还是措辞?LLM数学推理中表面多样性与方法多样性的差距

LLM数学推理中的方法多样性捕捉了问题解决方法中的策略变化,揭示了表面多样性指标的局限性,并强调了直接优化多样化推理方法的挑战。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

当 SkyClaw-v1.0 说「专攻 Agent」,它到底在卖什么?

雷峰网讯 大多数人对 AI 模型的认知是粗粒度的,视觉模型、生图模型、大语言模型,分到这一层就停下了。但事实上,更专业的分工早就已经发生。同样的底座,可以训练出一个擅长聊天的助手,也可以训练出一个擅长干活的执行者。两者的智力水平或许差不多,但擅长的事完全不同。 5 月 26 日,昆仑万维发布全新模型 SkyClaw-v1.0,定价低到 0.5 元每百万 token。值得注意的是,官方将其描述为“一

大模型 AI 摘要 · 单一来源
雷锋网 阅读 →

他山科技联合图灵奖得主萨顿共建“机器人幼儿园”,具身智能从“模仿时代”迈向“经验时代”

雷峰网获悉,6月29日,“触碰真实·自主进化——机器人幼儿园启幕大会”在北京首钢园隆重举行。本次大会由他山科技与OpenMind Global Research共同发起,由北京具身智能研究院联合主办。大会上,由他山科技与2024年图灵奖得主、Openmind 全球研究院首席科学家理查德·萨顿(Richard Sutton)教授团队联合共建的“机器人幼儿园”正式揭牌。这是强化学习理论在具身智能领域的

机器人 AI 摘要 · 单一来源
雷锋网 阅读 →

小模型大作为:探索紧凑语言模型

小型语言模型可在无需GPU加速的情况下直接在设备上有效执行检索增强生成任务。

芯片 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

英伟达为什么选了 Sharpa 的手?ICRA 2026现场我们找到了答案

Sharpa技术布局拓展,正在自研数据采集方案。 作者丨向 欣 编辑丨高景辉 ICRA 2026期间,英伟达在GTC Taipei上发布的NVIDIA Isaac GR00T参考人形机器人,成为一大焦点。 “参考”二字已经定性。英伟达想把这套系统做成人形机器人的标准体。本体采用宇树H2 Plus,灵巧手来自Sharpa,算力模组是Jetson Thor,大脑是英伟达自研并开源的Isaac GR00

机器人 AI 摘要 · 单一来源
雷锋网 阅读 →

DOPD:双在线策略蒸馏

DOPD 通过基于优势差距和概率在师生策略之间动态路由 token 级监督,解决在线策略蒸馏中的特权幻觉问题,提升大模型和视觉-语言模型的能力迁移效果。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

VLA真的懂基本常识吗?测量视觉-语言-动作模型的世界知识保留

Act2Answer协议通过让智能体通过物理动作回答问题来评估具身视觉-语言-动作模型,揭示了不同语义类别中的知识保留和泛化模式。

机器人 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

杀上闭源前沿,国产最强已经无法满足 GLM-5.2 了

雷峰网讯 过去一周,AI 开发者圈讨论的焦点,已经不只是谁又发布了更强的模型,而是一个更现实的问题,谁还能稳定地调用到最强的模型? 随着美国对于 Fable 5 调用的限制,顶级闭源模型的可获得性终于成为了悬在开发者头上的不确定因素。特别是对于已经把大模型深度接入代码生成、Agent 工作流和企业应用的团队来说,一个模型哪怕性能再强,只要存在访问受限、策略调整、价格波动或突然下架的风险,就跟“可靠

大模型 AI 摘要 · 单一来源
雷锋网 阅读 →

UC Berkeley Ken Goldberg 教授:具身数据规模落后十万年,你仍然相信数据万能吗?| ICRA 2026

雷峰网讯 数以十亿计的资金涌入具身智能行业,与此同时,这些机器人真正完成的有效工作却屈指可数。落地压力的迫近之下,VLA 等无模型方案和传统 Model-Based 路线之间的分歧是如此强烈,以至于某种程度上,甚至带上了意识形态的色彩。 这成为了本届国际机器人与自动化会议(ICRA)现场最引人关注的话题。在会议第二天,UC Berkeley 教授 Ken Goldberg 发表了题为《Can GO

机器人 AI 摘要 · 单一来源
雷锋网 阅读 →

进化微调:跨 371 个优化任务的学习发现

进化微调通过学习搜索轨迹,使大语言模型获得跨任务的问题解决能力,在数学猜想和优化任务上展现出更优性能。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

BlockPilot:面向扩散式推测解码的实例自适应策略学习

通过从预填充表示预测最优块大小实现自适应块大小选择,在最小开销下显著提升推理效率。

硬件 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

多块扩散语言模型

多块扩散语言模型将单块扩散扩展至并发块解码,采用改进的训练策略和优化的解码算法。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

SkillHone:基于持续决策历史的智能体技能持续进化框架

SkillHone 通过维护持续决策历史并整合实践反馈,实现智能体技能的持续进化,提升研究任务和工具分析任务的性能。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

LLM 智能体中程序性记忆的管理:控制、适应与评估

程序性记忆通过跨角色和模型的技能迁移提升 LLM 智能体在工作场景任务中的表现,其泛化能力差异影响部署策略。

大模型 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

RedVox:跨语言语音模型的安全与公平差距

针对语音模型的多语言安全与公平基准测试揭示了跨语言和自然条件下的持续脆弱性。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

走访 ICRA 30+中国企业,我们发现具身智能产业三大趋势 | ICRA 2026

「机器人的未来在中国。」 作者丨向欣 张贤 编辑丨高景辉 6月5日,ICRA 2026在维也纳落幕。 作为机器人领域最具影响力的的国际会议之一,ICRA是一扇透视具身智能行业走向的绝佳窗口。6月1日,雷峰网·AI科技评论抵达音乐之都维也纳,全程参与了这场为期5天的盛会。 在现场我们看到,今年中国参展的具身智能企业数量众多,技术成果丰富。不少团队带来了新的机器人本体、灵巧手以及全套数据采集和算法展示

机器人 AI 摘要 · 单一来源
雷锋网 阅读 →

MemLearner:面向视频世界模型的学习查询上下文记忆

MemLearner 通过可学习的自适应上下文查询机制增强场景一致性和记忆,有效处理存在遮挡和动态物体的长视频序列。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

文生图开源第一易主,但 HiDream-O1-Image 为什么褒贬不一?

雷峰网讯 2026 年 5 月,智象未来开源了文生图模型 HiDream-O1-Image(8B),直接登顶 Artificial Analysis 开源模型全球第一,Elo 1187 的分数力压 Qwen Image(27B)和 FLUX.2 dev。值得注意的是,这也是 Artificial Analysis 榜单前十中唯一的开源模型。 但消息一出,有人说最强一代开源文生图模型“实至名归”,却

大模型 AI 摘要 · 单一来源
雷锋网 阅读 →

国产 Coding 争霸赛:MiniMax 爆冷登顶,DeepSeek 性价比称王

雷峰网讯 你很难把 Coding 仅仅视为大模型的诸多能力维度之一。 和单纯的文本或图像生成相比,代码更明确的规则、严格的语法和可验证的结果只是部分原因。更为特殊之处在于,在 ChatBot 到 Agent 这条进化链上,Coding 意味着的工具调用、数据处理和复杂流程自动化,几乎承载了模型从“会说”走向“能干”的绝大部分期待。 一个值得关注的变化是,Coding 正在从眼花缭乱的 Benchm

大模型 AI 摘要 · 单一来源
雷锋网 阅读 →

Agent 落地,数据库先变

雷峰网讯 AI 的竞争越靠近落地,越展现出其残酷的一面。Benchmark 上几分的得失正变得意义有限,取而代之的,是真金白银的投入产出比。Agent 如何真正读懂业务,模型智能如何在业务端释放出更大的价值,成为了这一阶段竞争最核心的命题。 而一同被推向舞台中央的,还有数据库。 过去,它扮演的角色很简单,本质就是一个长期、安全、可查询的数据存储系统。比如用户在淘宝购物,完成了下单、支付、退款、查物

研究 AI 摘要 · 单一来源
雷锋网 阅读 →

PhotoQuilt:基于自举分块去噪的无训练任意分辨率照片马赛克生成

PhotoQuilt是一个无需训练的框架,通过将全局布局构图与潜在空间中的独立块生成相结合来生成高分辨率照片马赛克,克服了扩散模型在平衡局部细节与全局结构方面的局限。

研究 AI 摘要 · 单一来源
HuggingFace Daily Papers 阅读 →

Anthropic 发布 Claude Sonnet 5:最具 Agent 能力的 Sonnet

Anthropic 上线 Claude Sonnet 5,称其为迄今最具 Agent 能力的 Sonnet——会规划、用浏览器与终端、自主运行,能完成此前 Sonnet 半途而废的复杂任务并主动自检。性能接近 Opus 4.8、显著超越 Sonnet 4.6;已成 Free/Pro 默认模型,8 月 31 日前介绍价输入 $2、输出 $10/百万 token。

大模型 AI 摘要 · 单一来源
@claudeai 阅读 →