来自 Twitter · Hacker News · GitHub 的 AI 行业动态
名为Play2Perfect的强化学习框架通过先学习多样物体的通用操作技能,再微调适配精确装配任务,实现样本高效的机器人装配。
GEAR通过表示对齐联合训练向量量化分词器和自回归生成器,采用双读出方法克服不可微分问题,提升收敛速度和特征质量。
PolyFlow 引入使用拓扑嵌入器的连续网格表示,并用流匹配和 Transformer 实现并行网格生成,相比自回归方法推理更快、分辨率控制更精确。
LLM数学推理中的方法多样性捕捉了问题解决方法中的策略变化,揭示了表面多样性指标的局限性,并强调了直接优化多样化推理方法的挑战。
雷峰网讯 大多数人对 AI 模型的认知是粗粒度的,视觉模型、生图模型、大语言模型,分到这一层就停下了。但事实上,更专业的分工早就已经发生。同样的底座,可以训练出一个擅长聊天的助手,也可以训练出一个擅长干活的执行者。两者的智力水平或许差不多,但擅长的事完全不同。 5 月 26 日,昆仑万维发布全新模型 SkyClaw-v1.0,定价低到 0.5 元每百万 token。值得注意的是,官方将其描述为“一
雷峰网获悉,6月29日,“触碰真实·自主进化——机器人幼儿园启幕大会”在北京首钢园隆重举行。本次大会由他山科技与OpenMind Global Research共同发起,由北京具身智能研究院联合主办。大会上,由他山科技与2024年图灵奖得主、Openmind 全球研究院首席科学家理查德·萨顿(Richard Sutton)教授团队联合共建的“机器人幼儿园”正式揭牌。这是强化学习理论在具身智能领域的
小型语言模型可在无需GPU加速的情况下直接在设备上有效执行检索增强生成任务。
Sharpa技术布局拓展,正在自研数据采集方案。 作者丨向 欣 编辑丨高景辉 ICRA 2026期间,英伟达在GTC Taipei上发布的NVIDIA Isaac GR00T参考人形机器人,成为一大焦点。 “参考”二字已经定性。英伟达想把这套系统做成人形机器人的标准体。本体采用宇树H2 Plus,灵巧手来自Sharpa,算力模组是Jetson Thor,大脑是英伟达自研并开源的Isaac GR00
DOPD 通过基于优势差距和概率在师生策略之间动态路由 token 级监督,解决在线策略蒸馏中的特权幻觉问题,提升大模型和视觉-语言模型的能力迁移效果。
Act2Answer协议通过让智能体通过物理动作回答问题来评估具身视觉-语言-动作模型,揭示了不同语义类别中的知识保留和泛化模式。
雷峰网讯 过去一周,AI 开发者圈讨论的焦点,已经不只是谁又发布了更强的模型,而是一个更现实的问题,谁还能稳定地调用到最强的模型? 随着美国对于 Fable 5 调用的限制,顶级闭源模型的可获得性终于成为了悬在开发者头上的不确定因素。特别是对于已经把大模型深度接入代码生成、Agent 工作流和企业应用的团队来说,一个模型哪怕性能再强,只要存在访问受限、策略调整、价格波动或突然下架的风险,就跟“可靠
雷峰网讯 数以十亿计的资金涌入具身智能行业,与此同时,这些机器人真正完成的有效工作却屈指可数。落地压力的迫近之下,VLA 等无模型方案和传统 Model-Based 路线之间的分歧是如此强烈,以至于某种程度上,甚至带上了意识形态的色彩。 这成为了本届国际机器人与自动化会议(ICRA)现场最引人关注的话题。在会议第二天,UC Berkeley 教授 Ken Goldberg 发表了题为《Can GO
进化微调通过学习搜索轨迹,使大语言模型获得跨任务的问题解决能力,在数学猜想和优化任务上展现出更优性能。
通过从预填充表示预测最优块大小实现自适应块大小选择,在最小开销下显著提升推理效率。
多块扩散语言模型将单块扩散扩展至并发块解码,采用改进的训练策略和优化的解码算法。
SkillHone 通过维护持续决策历史并整合实践反馈,实现智能体技能的持续进化,提升研究任务和工具分析任务的性能。
程序性记忆通过跨角色和模型的技能迁移提升 LLM 智能体在工作场景任务中的表现,其泛化能力差异影响部署策略。
针对语音模型的多语言安全与公平基准测试揭示了跨语言和自然条件下的持续脆弱性。
「机器人的未来在中国。」 作者丨向欣 张贤 编辑丨高景辉 6月5日,ICRA 2026在维也纳落幕。 作为机器人领域最具影响力的的国际会议之一,ICRA是一扇透视具身智能行业走向的绝佳窗口。6月1日,雷峰网·AI科技评论抵达音乐之都维也纳,全程参与了这场为期5天的盛会。 在现场我们看到,今年中国参展的具身智能企业数量众多,技术成果丰富。不少团队带来了新的机器人本体、灵巧手以及全套数据采集和算法展示
MemLearner 通过可学习的自适应上下文查询机制增强场景一致性和记忆,有效处理存在遮挡和动态物体的长视频序列。
雷峰网讯 2026 年 5 月,智象未来开源了文生图模型 HiDream-O1-Image(8B),直接登顶 Artificial Analysis 开源模型全球第一,Elo 1187 的分数力压 Qwen Image(27B)和 FLUX.2 dev。值得注意的是,这也是 Artificial Analysis 榜单前十中唯一的开源模型。 但消息一出,有人说最强一代开源文生图模型“实至名归”,却
雷峰网讯 你很难把 Coding 仅仅视为大模型的诸多能力维度之一。 和单纯的文本或图像生成相比,代码更明确的规则、严格的语法和可验证的结果只是部分原因。更为特殊之处在于,在 ChatBot 到 Agent 这条进化链上,Coding 意味着的工具调用、数据处理和复杂流程自动化,几乎承载了模型从“会说”走向“能干”的绝大部分期待。 一个值得关注的变化是,Coding 正在从眼花缭乱的 Benchm
雷峰网讯 AI 的竞争越靠近落地,越展现出其残酷的一面。Benchmark 上几分的得失正变得意义有限,取而代之的,是真金白银的投入产出比。Agent 如何真正读懂业务,模型智能如何在业务端释放出更大的价值,成为了这一阶段竞争最核心的命题。 而一同被推向舞台中央的,还有数据库。 过去,它扮演的角色很简单,本质就是一个长期、安全、可查询的数据存储系统。比如用户在淘宝购物,完成了下单、支付、退款、查物
PhotoQuilt是一个无需训练的框架,通过将全局布局构图与潜在空间中的独立块生成相结合来生成高分辨率照片马赛克,克服了扩散模型在平衡局部细节与全局结构方面的局限。
Anthropic 上线 Claude Sonnet 5,称其为迄今最具 Agent 能力的 Sonnet——会规划、用浏览器与终端、自主运行,能完成此前 Sonnet 半途而废的复杂任务并主动自检。性能接近 Opus 4.8、显著超越 Sonnet 4.6;已成 Free/Pro 默认模型,8 月 31 日前介绍价输入 $2、输出 $10/百万 token。
HeRA 对齐 MLLM 中的单个注意力头以保留跨模态局部邻域关系,提升视觉中心任务性能并减少视觉幻觉。
多智能体 LLM 系统中的延迟验证可能导致不稳定和振荡,但基于事实的回答可通过将真相作为吸引域来稳定系统。
采用 Diffusion Transformer 和 LoRA 适配及自增强训练数据的基于样例人像修饰框架,实现卓越质量和身份保持。
SWE-Together 是一个多轮编程基准测试,基于真实用户与智能体交互创建,包含反应式 LLM 模拟器,可根据最终正确性和交互效率评估智能体。
NVIDIA(NVDA)向 SEC 提交 8-K 文件:8-K。Accession 0001045810-26-000056。