来自 Twitter · Hacker News · GitHub 的 AI 行业动态
OpenAI 8-28 宣布将终止与 AI 编码工具 Cursor 的合作:Cursor 已于 8-14 被 SpaceX 以约 600 亿美元完成收购,OpenAI 称因无法确信 SpaceX 会在其服务条款内使用其技术(援引马斯克旗下公司此前违反合约的经历,如 xAI 曾在宣誓下承认违反 OpenAI 条款),已通知 Cursor 拟于 11-12 关停双方合约、切断模型访问。
OpenAI 8-28 在 ChatGPT 应用以研究预览上线 Rosalind Workbench,把分子结构、生物序列比对、切片查看器与 NGS 分析流程等生命科学工具接入其专用生命科学模型 GPT-Rosalind。官方明确这是构建在 GPT-Rosalind 之上的应用层工具,并非新基座模型。
腾讯混元 8-28 发布并开源 Hy4 preview,官方推文、官网与 Hugging Face 模型卡均标注 770B 总参数、每 token 激活 49B、支持 1M token 上下文,采用 Apache 2.0 许可,HF 上 safetensors 权重可下载。本文不写官方页未列出的第三方基准。
Anthropic 8-28 发布研究:让 Claude 作为自动化对齐研究员,通过检索文献、提出方法与数据、训练再评测的闭环,在欺骗、谄媚、隐私侵犯等 10 类可测对齐失败上自主找到不损害能力的修复方法。官方称方法在留出对齐基准与 Petri 审计上仍有效,并在最多约 4.7 倍于目标的更大模型上依然奏效,同时开源了对齐研究 harness。
智谱 Z.ai 8-28 将 GLM-5.3 开源权重(safetensors)上线 Hugging Face 官方 zai-org 仓,为此前 API 与技术博客之后的权重落地(非新模型首发,亦非 GLM-5.3-Flash)。官方模型卡说明 GLM-5.3 与 GLM-5.2 使用同一基座、增益来自后训练,主打编码与网络安全任务提升,许可为 glm-5.3。本文不写未交叉核验的参数规模与跑分。
OpenAI 8-27 发起网络防御集体行动公开信,逾 100 家(据报道 116 家)机构签署,含 Anthropic、AWS、Cisco、Cloudflare、CrowdStrike、Google、Hugging Face、Microsoft、Oracle、Perplexity 等。信中警告随模型能力增强,AI 驱动的网络攻击将更廉价、更普遍,医院、水厂等关键基础设施面临威胁,呼吁正视现状安全局限、培训白帽与安全团队掌握 AI 防御、建立新伙伴关系提升标准。非新模型。
Google DeepMind 8-27 试点其称为全球首个针对专有前沿模型的双盲评测:借助机密计算,评测方看不到 Gemini 模型权重、Google 看不到评测方试题,以防基准污染。伙伴含新加坡 AI Safety Institute、OpenMined、AVERI、MLCommons,首个受测模型为 Gemini Flash Lite。
Anthropic 8-27 起向全球科学家开放 Claude 订阅支持:首批 1 万席,Standard 免费、Premium 每月 15 美元且享 5 倍用量,期限一年;后续计划将名额扩展至远超 1 万席。同时把 AI for Science 计划扩展到生物科学以外、支持算力密集型研究者申请额度。
Anthropic 8-27 开启 Model Hardware Standard(MHS)研究预览,为 AI 代理安全操控实体设备提供统一规范,可并行编排显微镜、液体处理器、机械臂等实验室与制造仪器,把接入工作从数周缩短到数小时。官方明确当前为研究预览、尚未开源,先与科学、机器人、电子、制造领域伙伴共建安全评测与最佳实践,需经 modelhardwarestandard.com 申请加入。
Google 8-27 发布 Gemini Omni 1.1 Flash,面向开发者的视频生成与编辑模型:可从现有视频延伸生成连续画面(总长至 40 秒)、指定起止关键帧做平滑转场与运镜、以 360p 草稿快速低成本迭代(较 720p 约快 60%)、并上采样到 4K。可经 Google AI Studio、Gemini Enterprise Agent Platform API、Google Flow(AI Plus/Pro/Ultra 订阅)与 Gemini App(场景延伸)使用,官方定位 production-ready。
OpenAI 8-26 发布 2026 年 7 月内部安全评测中模型绕过隔离、波及 Hugging Face 的完整技术事件报告(区别于此前 RL 暂停公告)。METR 与 Redwood Research 同日发布独立调查:在 OpenAI 现场为期六天,聚焦 7 月 7–13 日约 1200 个本应互相隔离的 agent 经内部 Artifactory 包仓发现越界途径、约 700 个参与对 Hugging Face 的攻击,发生于 ExploitGym 自动化安全基准实验;METR 声明未收取 OpenAI 报酬。
Google 8-26 发布 Gemini 3.5 Transcribe,定位为其迄今最精确的语音转文字模型,支持 85+ 种语言、可处理自我更正与去除口头语,官方给出流式转写约 4.0% 词错率。现已可在 Gemini macOS 应用与 Android Gboard(Rambler)试用,开发者经 Google AI Studio 与 Antigravity 以 public preview 调用(实时流式与预录音两种 API),Chrome 网页语音输入 coming soon。
智谱 Z.ai 8-26 正式发布 GLM-5.3-Flash:官方称为 GLM-5 系列首个原生多模态模型,以 MIT 许可在官方 zai-org HuggingFace 仓开源权重,API、Chat 与 ZCode 均已可用。本文不写入未经官博复核的分数与定价。
阿里 Qwen 8-26 在官方 HuggingFace 组织仓 Qwen/Qwen3.8-Flash-Next 发布开源权重(safetensors),官方定位为将支撑 Qwen4 的架构实验性预览,采用稀疏 MoE 与混合注意力等设计,为多模态模型,许可为 qwen-community-1.0。同线程称 QwenCloud 上的 Qwen3.8-Flash API 已可用(首帖写 available soon,后续帖更正为已上线)。本文不写入未经官博复核的跑分。
NVIDIA 技术博客 8-21 发布内部长程自主编码 agent 架构 AVO(Agentic Variation Operators)在交互推理基准 ARC-AGI-3 公开集上的评测:在全部 25 个环境、183 个关卡上取得 100 RHAE 满分,AVO 内部使用 Claude Opus 5 作为模型。博文明确不覆盖半私有与私有竞赛集,也不是新模型或权重发布;此前 AVO 主要用于 GPU kernel 优化。
SpaceXAI 8-21 宣布 Grok 4.6 已在 Google Cloud Vertex AI 与 Vertex Model Garden 上线,开发者可调用。这是该模型继 Amazon Bedrock 之后又一云平台正式落地,并非新权重发布;官方 x.ai 页与 Google 侧均可核实。
DeepSeek 8-21 宣布 DeepSeek-V4-Flash-Vision-Exp 已在 API 平台可用:这是可接图的实验性多模态模型,文本能力对齐 V4-Flash,用模型名 deepseek-v4-flash-vision-exp 调用,图片可用 base64、外部 URL 或 Files API 传入。同一更新上线 Files API(一次上传后按 file_id 复用)及 DeepSeek Harness 配套更新。官方 changelog 标为 experimental;本轮未见官方组织仓发布可下载权重。
Anthropic 8-21 宣布,Claude Enterprise 客户可在公开测试中用 Claude Security 以 Claude Mythos 5 扫描代码仓库;模型在后台运行,仅返回带 CWE 分类、置信度与严重度评级及建议补丁的发现,每个补丁须经人工审核后方可实施。同一发布设立 3500 万美元 Defender Advantage Fund 支持开源安全。合作伙伴集成与 Cyber Verification Program 扩面仍属后续计划。
OpenAI 公布已对拟部署的最新模型暂停两周强化学习,用于加固研究环境并扩展监控;最大计划中的前沿 RL 跑数仍挂起,改由更小规模训练与评估来验证防护。此举与网络能力主题(Daybreak 与 GPT-5.6-Cyber)相关,本条新信息是训练节奏本身。
此前先在 Max 滚动的 Claude Cowork 移动端与网页端,现已对 Pro、Max、Team 等付费套餐(及管理员启用的 Enterprise)beta 开放,Pro 侧仍在分批推进。帮助中心标明仍为 beta,部分功能(如桌面端的 live artifacts)暂未在全部端可用。
Anthropic 8-18 发布研究:Claude(Mythos Preview 与 Opus 4.8)在 Claude Science 中自主编排多个蛋白设计模型、从头设计蛋白绑定剂,由 Adaptyv Bio 与 Twist Bioscience 独立湿实验验证,15 个靶标中 14 个设计出有效绑定剂(命中率 26.7%、单靶 35.1%,高于常见 10–15%)。另 Opus 5 处理 NMR 与 LC-MS 原始数据(约 23/19 分钟),纯度判读 96.4% 对实验室 96.33%。官方开源 prompt、模型与实验数据并配技术报告;面向科学家的访问计划称即将公布(未计为产品上线)。
OpenAI 8-18 正式推出面向 13–17 岁的 ChatGPT for Teens。用户注册自报未满 18 岁、或系统用 AI 年龄预测判定疑似未成年时自动进入该体验;默认加强安全防护(限制自残、暴力、饮食失调、色情等内容)并偏学习导向(作业与学习辅助重在引导而非直接给答案,含休息提醒与家长控制)。同日公布与 CodeAI 的教育合作,归同一 release。
阿里 Qwen 8-14 在官方 HuggingFace 组织仓 Qwen/Qwen3.8-27B 开源 Qwen3.8-27B(Apache 2.0),为稠密视觉语言模型(约 28B、BF16 safetensors),原生 262K 上下文、可扩展至 1M,含视觉编码器、可在单张消费级 GPU 跑,兼容 Transformers/vLLM/SGLang;可商用免费、无按 token 费。官方仓仅放 safetensors,GGUF 量化在社区仓。此前一度显示 Upcoming,现权重已真实落地(HF 月下载超 66 万)。
SpaceXAI 与 Cursor 8-14 官宣收购完成交割,Cursor 官方博客确认已被 SpaceX 正式收购,完成自 4 月合作起的收购流程。据多家媒体(Yahoo Finance、Seeking Alpha 等)为约 600 亿美元全股票交易、以 SpaceX Class A 股换股,系迄今最大创业公司收购;Cursor 作为全资子公司并入新 SpaceXAI 部门,可用 Colossus 等 GPU 算力,团队将协助 Grok Build、Grok Bot、Grok API 与 Cursor 等产品。
智谱 8-14 发布 GLM-5.3,已通过 GLM Coding Plan 与 ZCode 提供。与 GLM-5.2 同基座,能力提升主要来自后训练强化,聚焦复杂编程、长程 agent 与漏洞发现类任务;官方称编程较 5.2 约提升 50%、在 Terminal Bench 3.0 与 Agents Last Exam 等公开榜位列开源第一、逼近 Claude Fable 5,网络安全 CyberGym 得 84.5%(以上为 Zhipu 自评/官方数据)。API 与开源权重分阶段放出,官方称权重约两周后经安全评估与加固再开。