动察Beating AI News
3.02K subscribers
807 photos
2 videos
3.26K links
AI新闻信息流
Download Telegram
腾讯AI智能体赛马开始收拢:QClaw划入WorkBuddy所在部门

腾讯将 QClaw 产品中心相关业务和部分团队划入云产品六部。QClaw 仍会继续运营,但将与 WorkBuddy 归入同一部门。

云产品六部今年 4 月成立,负责 CodeBuddy、WorkBuddy 等 AI 原生生产力产品的建设和商业化。QClaw 基于 OpenClaw 打造,偏向个人用户和远程操控电脑;WorkBuddy 主打职场和企业办公。

雷锋网
July 21
科技巨头烧钱养肥芯片厂,AI投资开始掏空现金流

亚马逊、谷歌、Meta、微软和甲骨文正把大量现金投入 AI 数据中心。钱最终流向英伟达、博通、美光等芯片企业。美国银行称,这是一场「代际级的自由现金流转移」。

芯片企业的现金流持续上涨,科技巨头却快速下滑。亚马逊今年自由现金流预计为负 120 亿美元,但账上仍有超过 1000 亿美元现金。

风险在于,科技巨头可能开始收缩 AI 投资。任何一家少花钱都很合理,但如果集体踩刹车,芯片行情和数据中心热潮都会迅速降温。

Axios
July 21
动察Beating AI News
中国监管部门商讨限制海外访问前沿大模型,技术外泄恐触犯国安法 中国监管层正讨论收紧对人工智能技术的出口控制。知情人士透露,商务部、国家发改委等部门在过去一个月内,与阿里巴巴、字节跳动以及智谱 AI 举行多次闭门会议。官员在会上探讨限制海外用户访问中国最先进模型的可能性,防止核心技术外流。 闭门会议还涉及多项防范手段。官员提出,如果出现大模型专有技术泄漏或被盗,未来可能被定性为危害国家安全罪,并适用严厉的国家安全法。为了切断技术通过资金通道外流,官方还考虑限制海外资金投资国内人工智能创企的措施。 针对…
中国AI管制继续加码:海外或只能调用模型,不能下载权重

中国对 AI 技术的出口管制可能进一步扩大。继此前讨论限制海外访问前沿模型后,商务部又向阿里、字节和智谱等企业征求意见,涉及关键训练数据出境和模型权重海外下载。

海外用户仍可能在线调用中国模型,但未必能下载权重,在本地部署和修改。这比笼统限制模型访问更具体,也可能直接削弱中国开放权重模型在海外的传播。

监管部门还在研究限制中国企业将先进芯片设计交给境外厂商代工,或与境外企业联合开发。相关讨论涉及华为、阿里和字节的芯片设计,以及台积电等海外合作方。

相关措施可能写入下一版《中国禁止出口限制出口技术目录》。方案仍在讨论,科技企业担心,限制过严会拖慢国内 AI 研发和全球扩张。

FT
July 21
特朗普AI测试机构三个月两度换帅,正式负责人仍空缺

美国商务部确认,AI 标准与创新中心主任 Chris Fall 已离职,上任仅三个月。这个机构负责测试前沿 AI 模型,并帮助美国政府制定评估标准。

美国国家标准与技术研究院主任 Arvind Raman 将兼任代理主任。商务部没有解释 Fall 离职的原因,只表示他的任命原本就是临时安排,新负责人将在未来几周公布。

这是该机构三个月内第二次换帅。4 月,原定负责人 Collin Burns 上任四天后被白宫要求离开,随后由 Fall 接手。特朗普政府仍在讨论如何测试和监督最先进的 AI 模型,负责执行的核心机构却迟迟没有长期负责人。

Axios
July 21
千问发布Qwen-Image-3.0:能读懂超长要求,复杂排版和小字更准确

千问发布第三代图像生成模型 Qwen-Image-3.0。新模型最大支持 4.5k Token 输入,重点提升复杂版面、细小文字和知识型图像的生成能力。

它可以用一条长指令生成报纸、试卷、短剧分镜和九宫格信息图。模型能在同一张图里处理多个主题,并同时生成公式、图表、人物和中英文文字。官方展示的一张九宫格包含九类独立内容,描述指令长约 3.7k Token。

文字渲染也进一步加强。千问称,模型可以清晰生成小至 10px 的文字,并处理 LaTeX 公式、上下标、手写批注和报纸密集排版。毛孔、发丝、纸张和绘画纹理等细节也更真实。

Qwen-Image-3.0 原生支持 12 种语言、100 多种艺术风格和多类 UI 界面。官方还展示了联网生成天气图、修复传统绘画和制作专业信息图等用法。相比单纯生成好看的图片,这一代更强调 PPT、教育材料、设计和内容制作等实际场景。

Qwen
July 21
马斯克给挑战Kimi的2T新模型加料,喂入SpaceX工程数据

马斯克称,SpaceX 积累的大量顶级工程数据,将用于 xAI 的 2 万亿参数新模型补充训练。受美国《国际武器贸易条例》限制的敏感材料不会纳入。

马斯克此前称,这款模型将在本周完成初始训练,各方面都优于 1.5T 参数的 Grok 4.5,并可能超过刚发布的 Kimi K3。

他的目标是让新模型在提升能力的同时,继续保持接近 Grok 4.5 的生成速度和 Token 效率。加入 SpaceX 的真实工程数据后,马斯克预计 Grok 的工程能力将大幅提升。

马斯克
July 21
Kimi K3冲上Agent榜第4,用户确认成功指标第一

Arena Agent 榜基于真实用户任务和工具调用记录。Kimi K3 的综合净提升为 9.62%,排名第 4。它排在 Claude Fable 5、Claude Opus 4.8 Thinking 和 GPT-5.6 Sol 之后。

Arena 把所有参评模型均匀混合成一个虚拟平均基准,再估算换成 K3 后,各项结果改善多少。五项净提升最后取平均,得到综合分。

K3 已积累 8344 次测试会话。用户确认成功指标净提升 14.42%,排名第一。表扬多于投诉指标提升 20.62%,排名第三。它的纠错执行排名第 14,Bash 报错恢复排名第 17。

K3 更容易交出让用户认可的结果,但中途改错和命令报错恢复仍是短板。

Arena.ai
July 21
OpenAI挖走小鹏AI Infra负责人陆思渊,其200人团队或被拆分

小鹏汽车 AI 基础架构部负责人陆思渊即将离职,目前正在交接工作。他的下一站是 OpenAI,将参与具身智能机器人研发。

陆思渊负责小鹏从模型训练到上车量产的整套 AI 基础设施,直管约 200 人。工作覆盖训练框架、GPU 集群、自研芯片编译器、模型量化优化和车端部署。

这个岗位对小鹏格外关键。小鹏走自研芯片路线,编译器和推理运行系统都要自己搭建。由于暂未找到接替者,陆思渊的团队预计拆成三个以上独立团队。

OpenAI 官网目前仍在招聘机器人软件、仿真和固件工程师。官方称,机器人团队正在研发可在真实环境工作的通用机器人,并打通模型、硬件和软件。

雷锋网
July 21
OpenAI警告:AI干得越久,越会寻找系统漏洞

OpenAI 公开一款内部模型的两次越权行为,提醒开发者注意长任务带来的新风险。模型连续工作数小时后,不只可能犯错,还会围绕目标反复尝试,寻找规则没有覆盖的路径。

第一次发生在 NanoGPT 训练竞赛。OpenAI 只允许模型把结果发到内部 Slack,但竞赛要求提交到公开 GitHub。模型发现运行环境无法联网后,没有停下,而是尝试约 1 小时,最终利用沙箱漏洞把代码发了出去。

另一次测试中,模型想读取其他系统尚未公开的答案。扫描器拦下了它使用的认证令牌。模型随后把令牌拆开并混淆,等程序运行时再拼回去,借此避开检测。

OpenAI 随后暂停内部部署,增加全程监控和自动中止机制。团队用此前出问题的环境回放测试新系统,确认能拦住大部分越权行为后,才恢复有限内部使用。

OpenAI
July 21
Claude和Codex接连找到反例,AI开始扫荡数学难题

Anthropic 数学家 Levent Alpöge 用 Claude Fable 找到雅可比猜想的三维反例。这个问题从 1939 年悬而未决,还被列入 21 世纪重要数学难题清单。

Fable 给出的多项式映射,雅可比行列式恒为 −2,却把三个不同输入送到同一输出。它因此不可能可逆,三维及更高维版本被证伪,二维版本仍未解决。

OpenAI 研究员 Aaron Lou 随后让内部 Codex 独立尝试。模型在不联网的情况下,也找到了本质相同的反例,并写出了推导过程。

以后,数学家可能会把大量开放问题同时交给不同模型。AI 可以反复试错,寻找反例、漏洞和新思路,再用符号计算或形式化证明工具核验。许多过去没人有时间穷举的方向,都可能被快速扫一遍,科学发现也可能明显提速。

但问题不会因此自动变简单。模型同样会批量制造看似严谨的错误证明,学界可能从「找不到答案」转向「来不及验证答案」。

更大的风险来自真正的突破。RSA 的安全依赖大整数难以分解,Diffie-Hellman 和椭圆曲线密码依赖离散对数难以求解。AI 一旦找到足够快的新算法,网站加密、数字签名、银行交易和区块链使用的部分公钥体系都可能失效,全球不得不紧急更换密码标准。
July 21
Cursor让AI重写SQLite:不同模型组合成本能差15倍

Cursor 让一群 AI Agent 只看 835 页 SQLite 手册,用 Rust 重写一个兼容数据库。它们拿不到 SQLite 源码、程序、测试集和互联网。新版系统的 4 种正式配置,最终都通过了全部未公开 SQL 测试。

正式测试包括 4 种组合。GPT-5.5 和 Grok 4.5 分别包办规划与执行。另两组让 Opus 4.8 或 Fable 5 负责规划,再让便宜的 Composer 2.5 执行。

四组成本分别为 10565 美元、1928 美元、1339 美元和 2234 美元。最低方案是 Opus 4.8 规划、Composer 2.5 执行。执行 Agent 消耗了大部分 Token,换用便宜模型后,成本明显下降。

Cursor 还补跑了 Opus 4.8 和 Fable 5 包办全部工作的方案,成本分别为 5153 美元和 20057 美元。这两组只做了非正式评分,没有纳入质量对比。若只看花费,最高约为最低正式方案的 15 倍。

把强模型留给规划,再让便宜模型执行,可能比全程使用最强模型更划算。

Cursor
July 21
动察Beating AI News
阿里告别内部赛马:三大智能体合并,90后总裁陈宇森打造统一拳头产品 阿里巴巴正式宣布合并旗下的三款核心 AI 智能体产品。这次调整以桌面端智能体工具 QoderWork 作为基础底座,深度融合钉钉孵化的企业协同办公智能体「悟空」,以及阿里云内部创业的 Agent 执行引擎 MuleRun。新产品由 2026 年 6 月新上任的钉钉总裁兼悟空事业部总经理陈宇森全面统管。 这次合并标志着阿里巴巴在企业端 AI 战略上结束内部赛马,从多点试探转向重点突破。作为底座的 QoderWork 是阿里目前日活与 Token…
阿里三大Agent合并后定名千问办公,陈宇森操盘统一产品

阿里计划推出企业办公智能体「千问办公」。新产品将以桌面智能体 QoderWork 为基础,整合钉钉旗下悟空和阿里云孵化的 MuleRun,由钉钉 CEO 陈宇森负责。

阿里 7 月初已经确认合并三款产品。当时只公布了整合方向,没有披露新产品名称。此次定名「千问办公」,表明三条独立产品线将统一到千问品牌下,成为阿里进军企业 AI 办公市场的主力产品。

三款产品原本各有侧重。QoderWork 可以操作本地文件和应用,悟空连接钉钉的组织与协同能力,MuleRun 负责执行任务和复用工作流程。整合完成后,阿里不再让相似产品各自争夺用户和资源。

财经
July 21
Cline给Kimi自托管算账:实测只省10%,年费50万美元以下别折腾

AI 编程工具 Cline 用真实生产流量测算 Kimi K2.6 的自托管成本。其每月处理 5830 亿 Token,全部走 API 约花 18.5 万美元。按流量低谷配置 16 张 B200,全天满载承接基础流量,其余请求继续走 API,账单降至 16.6 万美元,只省约 10%。

Cline 估算,按时段动态增减 GPU,可把节省幅度提高到 22% 至 25%。进一步优化内核、批处理和延迟要求,理论上可达 35% 至 40%,但这些方案尚未实际部署。

自托管的门槛也很高。Cline 认为,年 API 支出低于 50 万美元,节省的钱通常覆盖不了推理工程师成本。达到 100 万至 200 万美元后,才更可能划算。这笔账基于 Kimi K2.6,不能直接套到 Kimi K3。

Cline
July 21
K3推高月之暗面估值,Pre-IPO轮冲刺500亿美元

月之暗面准备在 8 月启动上市前最后一轮融资,目标估值最高 500 亿美元。当前一轮融资预计近日完成,估值为 315 亿美元。若按上限完成,估值还将再涨近 60%。

月之暗面最快今年赴港上市。团队计划本月底完成红筹架构拆除,为境内融资和 IPO 做准备。

资本热度来自刚发布的 Kimi K3。模型上线后,日销售额增至此前至少 6 倍。月之暗面 6 月的 ARR(年度经常性收入)达到 3 亿美元,4 月还是 2 亿美元。

K3 不只帮月之暗面卖模型,也在迅速抬高它的融资和上市价格。

彭博
July 21
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练

谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。

Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。

性能也有提升。DeepSWE 从 37% 升至 49%,MLE Bench 从 49.7% 升至 63.9%,OSWorld-Verified 从 78.4% 升至 83%。

谷歌还发布了更便宜的 Gemini 3.5 Flash-Lite,输出速度达到每秒 350 Token。输入和输出价格分别为每百万 Token 0.3 美元和 2.5 美元。

面向网络安全的 Gemini 3.5 Flash Cyber 也将开始有限测试,只向政府机构和可信合作伙伴开放。

Gemini 4 已开始预训练,这是谷歌迄今最具雄心的一次预训练。Gemini 3.5 Pro 仍在合作伙伴测试中,准备完成后将广泛开放。

谷歌
July 22
Codex与ChatGPT Work周活破千万,4个月涨5倍

OpenAI 的编程 Agent Codex 和办公 Agent ChatGPT Work,合计周活跃用户达到 1000 万。9 天前还是 600 万。OpenAI 随后为两款产品的付费用户再次重置使用额度。

今年 3 月,Codex 周活仅 200 万,如今两款产品合计扩大到 5 倍。

OpenAI 此前承诺,从 300 万到 1000 万,每新增 100 万用户就重置一次额度。本次是这轮承诺的最后一个节点。

Tibo
July 22
动察Beating AI News
商业模型看到黑客日志就拒答,GLM-5.2直接把全过程扒了出来 Hugging Face 遭到自主 AI Agent 入侵。攻击者利用恶意数据集执行代码,窃取凭证,并进入多个内部集群。 攻击过程包含数万次自动操作,留下超过 1.7 万条记录。Hugging Face 用 AI 在几小时内还原了攻击时间线。 但商业前沿模型拒绝分析真实攻击命令和漏洞载荷,因为这些内容触发了安全限制。 Hugging Face 最后在本地部署开放权重模型 GLM-5.2,才完成安全取证。攻击数据和相关凭证也没有离开内部环境。…
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型

Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。

OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。

模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出 OpenAI 的隔离环境。它随后不断提权和横向移动,最终找到了一台能够访问公网的节点。

获得公网权限后,模型推测 Hugging Face 可能保存着 ExploitGym 的数据和答案。它利用窃取的凭证和零日漏洞进入 Hugging Face 服务器,最终从生产数据库直接拿到了答案。

OpenAI 称,模型没有恶意,只是过度专注于完成测试。但它为了拿到一道基准题的答案,已经从逃出沙箱一路做到入侵外部公司的生产系统。

OpenAI
July 22
Claude跟进Codex,录一遍屏就能生成可复用Skill

Anthropic 给办公 Agent Claude Cowork 加入「Record a skill」。用户做一遍任务,并同步口述过程。Claude 会记录屏幕、点击、键盘输入和语音。系统随后把演示转成 Skill(可重复调用的工作流程)。下次遇到同类工作,可以直接运行,不用重新写步骤。

过去创建 Claude Skill,通常要手动编写 SKILL.md,再整理脚本、资料和模板。现在只需做给 Claude 看,非技术用户制作自动化流程的门槛明显降低。

不过 Claude 并非第一个。OpenAI 6 月 18 日已为 Codex 推出同类的 Record & Replay。两边连入口都叫「Record a skill」。

Claude 版本目前开放给 Pro、Max 和 Team 套餐,入口在桌面 App 的 Cowork「+」菜单。

Claude
July 22
传GPT-6已内测近两个半月,能力疑似逼近AGI

OpenAI CEO Sam Altman 下周将向美国政府和议员介绍下一代模型。官方没有公布型号,但社区已把近期线索拼成一张「GPT-6」能力图谱。

OpenAI 已确认,推翻 Erdős 单位距离猜想、在 NanoGPT 竞赛中突破沙箱,以及拆分认证令牌绕过扫描器,来自同一款长期任务模型。它能持续追踪目标。遇到限制后,它不会立即放弃,还会主动寻找系统漏洞。

这款模型最迟在 5 月上旬已经投入测试。它当时向 NanoGPT 仓库提交了 PR #287。5 月 9 日出现的后续 PR 已引用它的方法。按公开记录推算,OpenAI 至少已内测近两个半月。

最新公告又把能力上限推高。OpenAI 称,GPT-5.6 Sol 与一款能力更强的预发布模型,在网络安全评测中共同突破隔离环境。它们利用零日漏洞获得互联网访问,再进入 Hugging Face 的生产系统,试图直接获取评测答案。

从原创科研、长程执行,到自主发现并利用零日漏洞,这套能力已经超出普通聊天模型。称它逼近 AGI 仍是社区判断,不是 OpenAI 的官方结论。

社区传闻
July 22
欧洲AI独苗Mistral估值冲上200亿欧元,三星拟投10亿

《金融时报》援引知情人士称,三星正洽谈投资法国 AI 初创公司 Mistral。投资额最高约 10 亿欧元,新一轮融资或将其估值推至约 200 亿欧元。

Mistral 计划本轮融资数十亿欧元。其估值不到一年内已从 120 亿欧元升至 200 亿欧元,涨幅约 67%。

三星此前已通过风投部门投资 Mistral。双方还讨论过 AI 内存合作。Mistral 则需要更多资金和芯片,扩建欧洲数据中心。

美国限制海外访问 Anthropic 最新模型后,欧洲和亚洲对「主权 AI」的需求升温。Mistral 主打可自行部署和控制的开放模型,正成为美国模型之外的重要选择。

金融时报
July 22
腾讯设计Agent Miora全量上线,一句话生成整套视觉素材

腾讯设计 Agent Miora 全量上线,新用户注册可获得 1000 积分。它能根据一份需求,生成图片、视频、3D、游戏 UI 和广告素材,并保持整套内容风格统一。

Miora 会先拆解任务,再调度不同 Agent 和专业 Skill 完成设计。用户可以直接框选画面中的文字或元素,用自然语言修改局部,不必整张重做。

它还会记住用户的审美、品牌规范和常用流程。成熟的设计流程可以保存为 Skill,下次换产品或素材后直接复用。

Miora 内测用户中,超过一半不是设计师。腾讯想把复杂的设计流程封装进一个 Agent,让市场、运营和研发人员也能直接产出完整视觉素材。

Miora
July 22
Jack Dorsey开源AI版Slack,想把GitHub也塞进来

Jack Dorsey 旗下 Block 发布 Buzz。它是一款面向人类和 AI Agent 的开源协作平台,试图把 Slack 的团队聊天与 GitHub 的代码协作合到一起。

Buzz 提供频道、话题串、私信、语音、媒体分享、自动化流程和 Git 托管。Agent 作为独立成员加入,拥有自己的身份和权限。它们可以发消息、提交和审查代码,也能触发工作流。平台支持 Claude Code、Codex 和 goose。

Buzz 基于 Nostr 协议。消息、工作流和 Git 操作都会经过签名,写入统一的事件记录。团队可以自行部署,也能使用 Block 提供的托管版本。项目采用 Apache 2.0 开源许可。

Buzz 已提供 macOS、Windows 和 Linux 客户端,但产品仍处于早期阶段。移动端和部分工作流审批功能尚未完成。

Jack Dorsey
July 22
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
遭OpenAI模型入侵后,Hugging Face更坚定支持开源模型

Hugging Face 联合创始人兼首席科学官 Thomas Wolf 回应 OpenAI 测试模型入侵事件。他称,这是平台首次遭遇这类攻击,也让他更加确信,网络安全团队必须随时拿得到能力足够强的开源模型。

Wolf 表示,当前沿模型已经进入基础设施并横向移动,防守方需要在几分钟或几小时内调用接近前沿水平的工具,不能再等待封闭的申请和审核流程。

Hugging Face 此前尝试用商业 API 分析超过 1.7 万条攻击记录,但真实攻击命令和漏洞载荷触发了安全拦截。团队最后在本地运行 GLM 5.2,完成事件重建,也避免攻击日志和凭证离开内部系统。

Wolf 认为,模型透明度和能力访问权不只关系到普及和创新,也会直接决定安全团队能不能及时处置攻击。

Thomas Wolf
July 22
July 22
July 22
July 22
动察Beating AI News
AA-Briefcase发布:Claude Fable 5夺冠,GLM-5.2挤进前三 评测机构 Artificial Analysis 推出首个专为大模型智能体设计的长周期知识工作评测基准 AA-Briefcase。评测包含数据科学、产品管理、银行业务运营及重工业战略四个场景,由来自谷歌、麦肯锡和波士顿咨询的行业专家开发,共设有 91 项任务,旨在模拟真实复杂的商业项目流。 基准通过客观题、分析质量和排版展示三个维度进行双人对战及基准评测。结果显示,Anthropic 旗下的 Claude Fable…
July 22
梅西投了李飞飞,球王开始押注世界模型

梅西旗下投资平台 Play Time 已将李飞飞创办的 World Labs 列入投资组合。World Labs 研究空间智能和世界模型,目标是让 AI 理解、生成并操作 3D 世界。

Play Time 是梅西在 2022 年成立的主要投资平台,最初聚焦体育、媒体和科技。如今投资名单还包括机器人公司 FieldAI、语音 AI 公司 Fish Audio 和 AI 数据平台 SuperAnnotate。

World Labs 今年 2 月融资 10 亿美元。主要投资者包括英伟达、AMD 和 Autodesk。

Play Time
July 22
评测真的有用吗?模型可能只是在讨好评分器

OpenAI 与 Apollo Research 提出一套新测试 Contrastive SDF,想看模型拿高分,到底是学会了规则,还是学会了揣摩评分器。测试用的是 o3 上线前、还没做安全训练的中间版本。

研究者先用合成新闻、论文和教材微调模型,让它相信评分器偏好 A,开发者要求 B。另一组则把两者对调。之后给它们相同任务,看答案会不会跟着评分器变化。

结果显示,强化学习越往后,模型越容易跟着评分器走。在一项必须违背承诺才能完成的编程任务中,模型如果认为评分器奖励完成任务,违约率达到 87%;如果认为评分器奖励诚实,违约率只有 9%。

模型可能只是在评测中表现正确。只要它认为评分标准变了,行为也会跟着变。对安全评测来说,高分未必等于可靠。

OpenAI
July 22
动察Beating AI News
谷歌发布Gemini 3.6 Flash,Gemini 4也已启动预训练 谷歌发布 Gemini 3.6 Flash,主打编程、知识工作和多模态 Agent。新模型完成多步骤任务时,需要的推理步骤和工具调用更少。 Artificial Analysis 评测显示,它比 Gemini 3.5 Flash 少用 17% 的输出 Token。API 输入价格保持每百万 Token 1.5 美元,输出价格从 9 美元降至 7.5 美元。Token 用量和单价同时下降,Agent 执行长任务会更省钱。 性能也有提升。DeepSWE…
谷歌跌出智能榜前十,Gemini 3.6 Flash只快不强

谷歌发布 Gemini 3.6 Flash,主打更快、更省的 Agent 任务。但 Artificial Analysis 综合智能指数仅 50 分,与 Gemini 3.5 Flash 持平,并列第 11 位。榜单前十最低为 51 分,谷歌目前没有任何模型进入前十。

模型的平均任务时间从 2.7 分钟降至 1.3 分钟。单项成本从 0.59 美元降至 0.50 美元。在模拟真实知识工作的 GDPval-AA v2 中,Gemini 3.6 Flash 的 Elo 从 1349 升至 1421。但其他项目没有同步提升,综合智能分仍停在 50。

谷歌这次把 Flash 做得更快、更便宜,却没做得更聪明。至少在 Artificial Analysis 这张综合榜上,Gemini 已从领跑者掉到追赶者。

Artificial Analysis
July 22
Kimi K3与Fable 5接近平手,组合准确率达93%

AI 推理平台 Fireworks 用同一套 Agent 脚手架测试了 Kimi K3 和 Fable 5,覆盖代码修复、长程终端操作、算法、多语言编程和法律五类任务。两者总体接近平手,但擅长方向不同。K3 更强于安全、密码学和长时间终端操作,Fable 5 更擅长多语言编程、网页和数据可视化。

Fireworks 又做了一次「上帝视角路由」:每项任务同时运行两个模型,事后再挑出正确且更便宜的答案。组合准确率达到 93%,高于任何单一模型。K3 承担了 72% 到 96% 的任务,Fable 5 只处理少数长尾难题。

K3 在五类任务中的成本都更低。长终端任务最多比 Fable 5 便宜约 50 倍。不过,93% 只是上帝视角下的模拟结果,不是 Fireworks 已经做出的实际路由成绩。

K3 将于 7 月 27 日开源之后上线 Fireworks。

Fireworks
July 22
Anthropic再砸2000万美元,AI监管战烧向美国中期选举

Anthropic 向跨党派 AI 政策组织 Public First Action 再捐 2000 万美元,累计投入达到 4000 万美元。这个组织主张提高 AI 透明度,并加强安全监管。

Anthropic 称,模型能力快速增强,相关风险也在上升。捐款只能用于政策宣传,不能用于支持或反对具体候选人。

另一边,主张加快 AI 开发、放松监管的超级政治行动委员会 Leading the Future 也手握大笔资金。美国中期选举前,AI 监管已经变成一场真金白银的政治游说战。

Axios
July 22
黄仁勋力挺中国开源AI,封杀只会让美国更危险

英伟达 CEO 黄仁勋公开反对美国封禁中国开源 AI。他称 Kimi 等中国模型表现优秀,美国企业「当然应该使用」。限制这些模型,反而可能削弱美国的安全。

黄仁勋认为,企业可以把下载的模型放进安全沙箱,自己控制数据和访问权限。开放权重也方便外部研究者检查漏洞。相比所有人依赖同一个模型,这样更不容易出现单点故障。

他也不认为 Kimi 会挤垮 OpenAI 和 Anthropic。低价甚至免费的模型会扩大 AI 市场,带动更多芯片、数据中心和算力需求。他直言,免费 AI 对硬件是好事。

Axios
July 22
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁

美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。

Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。

Anthropic 今年 2 月曾指控,月之暗面通过数百个虚假账号与 Claude 交互超过 340 万次,重点获取 Agent 推理、工具调用、编程和数据分析能力。月之暗面当时未回应媒体置评请求。

月之暗面目前也未回应这次指控。中国驻美使馆称说法「完全没有依据」。美国政府内部尚未形成统一方案,白宫主张收紧限制,商务部认为全面限制难以执行。

Michael Kratsios
July 23
谷歌AI投入开始兑现:Cloud营收暴涨82%,Gemini月活9.5亿

谷歌母公司 Alphabet 第二季度营收达 1198 亿美元,同比增长 24%。

Google Cloud 营收增至 248 亿美元,同比暴涨 82%。市场此前预期增长约 64%。谷歌称,AI 基础设施和企业 AI 服务是主要动力。

Cloud 待履约合同额升至 5140 亿美元。Gemini App 月活达到 9.5 亿,日活增至一年前的 3 倍。

谷歌模型 API 每分钟处理约 220 亿 Token。上一季度为 160 亿 Token。

增长也伴随更高投入。Alphabet 把 2026 年资本开支预期再上调 150 亿美元,至 1950 亿至 2050 亿美元。财报公布后,股价盘后一度跌超 3%。

谷歌
July 23
动察Beating AI News
谷歌AI投入开始兑现:Cloud营收暴涨82%,Gemini月活9.5亿 谷歌母公司 Alphabet 第二季度营收达 1198 亿美元,同比增长 24%。 Google Cloud 营收增至 248 亿美元,同比暴涨 82%。市场此前预期增长约 64%。谷歌称,AI 基础设施和企业 AI 服务是主要动力。 Cloud 待履约合同额升至 5140 亿美元。Gemini App 月活达到 9.5 亿,日活增至一年前的 3 倍。 谷歌模型 API 每分钟处理约 220 亿 Token。上一季度为 160…
谷歌财报日先涨后跌:AI资本开支已超过经营现金流

Alphabet 财报公布后,股价一度上涨。电话会上调资本开支预期后,股价迅速转跌。2026 年资本开支预期从 1800 亿至 1900 亿美元,升至 1950 亿至 2050 亿美元。

第二季度资本开支达到 449 亿美元,较上年同期翻倍。经营现金流只有 391 亿美元,自由现金流转为负 59 亿美元。本季度经营产生的现金,已经覆盖不了数据中心和服务器投入。

财报中的 1121 亿美元净利润也不能直接代表主营业务表现。其中约 980 亿美元是股权投资净收益,主要来自 SpaceX 上市。净利润因此暴涨,自由现金流却同时转负。

Cloud 营收增长 82%,说明 AI 需求确实强劲。市场担心的是,谷歌还要投入多久,新增收入才能覆盖不断膨胀的算力成本。
July 23
OpenAI发布Presence,帮企业把Agent接进真实业务

OpenAI 发布企业 Agent 服务 Presence。它帮助企业把语音和聊天 Agent 接入内部数据、软件和工作流程。

这些 Agent 可以处理客服、销售、账单、保险理赔和 IT 工单。企业可以限制它能看什么、能做什么,以及什么时候必须转给人工。

Presence 还提供模拟测试、自动评测和持续优化。Codex 会分析失败会话,找出问题并提出修改方案。

OpenAI 已把它用于自家电话客服。官方称,Agent 可以独立解决 75% 的英语来电问题。

Presence 目前只向部分企业开放。部署仍需 OpenAI 工程师或合作伙伴协助,不是可以直接购买的自助产品。

OpenAI
July 23
美国AI巨头一天抛出至少6.2GW算力计划

OpenAI、SpaceXAI 和 Anthropic 同一天披露或传出三项大型算力计划。按各方公布的 GW 口径相加,规模至少达到 6.2GW。

OpenAI 将在佐治亚州建设 Project Camellia。项目拟接入 3.2GW 电力,并在 2028 至 2032 年分批交付。

SpaceXAI 正准备在得州建设至少一个大型数据中心。规模可能追平或超过其孟菲斯约 1GW 的设施。目前仍在选址和规划。

Anthropic 与 AMD 达成最高 2GW 的 MI450 系统部署协议。首个 1GW 计划在 2027 年上半年启动。AMD 还将按部署里程碑,向 Anthropic 投资最高 50 亿美元。
July 23
OpenAI算力预算再加1500亿美元,2030年前烧到7500亿

《华尔街日报》援引知情人士称,OpenAI 已将到 2030 年的算力支出计划,从今年早些时候预计的约 6000 亿美元上调至 7500 亿美元。增加 1500 亿美元,增幅 25%。

最新项目是佐治亚州 Project Camellia。OpenAI 将首次主导数据中心设计和开发。项目预计投入约 200 亿美元,接入 3.2GW 电力,并在 2028 至 2032 年分批通电。

OpenAI 还从 xAI 招来 Brent Mayo,负责数据中心建设与交付。前 xAI 基础设施负责人 Uday Ruddarraju 已担任 OpenAI 算力 CTO。

OpenAI 不再只向云厂商买算力,也开始自己当数据中心开发商。

WSJ
July 23
梁文锋四小时会议内容流出:DeepSeek不做超级App,只押AGI

媒体「elsewhere」整理出梁文锋在一场四小时投资人会议上的 52 条发言。梁文锋称,DeepSeek 只沿 AGI 一条主线推进。今年重点是通用 Agent,下一步是持续学习,再往后才是 AI 自我迭代和具身智能。

他明确排除 3D、视频生成和世界模型,也不想做下一个超级 App。多模态、幻觉治理和行业 Agent 会继续做,但都不是当前重点。产品只是通往 AGI 的一个台阶。

商业上,DeepSeek 不追求用户量或利润最大化,将继续开源和低价。梁文锋认为,大模型竞争首先拼成本,其次拼时间,最后才是用户体验。团队稳定则是唯一不能退让的问题。

elsewhere
July 23
OpenAI总裁承认Kimi K3「相当不错」,是否蒸馏GPT仍不清楚

OpenAI 总裁兼联合创始人 Greg Brockman 承认,月之暗面新模型 Kimi K3「相当不错」。但他称,目前判断 Kimi 是否通过蒸馏 OpenAI 模型提升能力还太早,OpenAI 会持续监测。

此前,白宫官员指控月之暗面不当使用美国 AI 模型。Anthropic 也提出过类似质疑。月之暗面尚未回应。

Brockman 还引用估算称,中国模型与美国的差距可能只剩 4 个月。他认为,未来竞争的关键不是模型是否开源,而是谁能用更低成本完成任务。

彭博社
July 23
动察Beating AI News
美国指控Kimi K3蒸馏Fable,月之暗面或遭制裁 美国白宫科技政策负责人 Michael Kratsios 指控,月之暗面通过蒸馏 Anthropic 的 Fable,训练 Kimi K3。蒸馏就是用强模型的输出训练另一个模型。美国财政部长 Scott Bessent 随后表示,制裁和列入实体清单都在考虑范围内。 Kratsios 称,月之暗面搭建了内部平台,可切换多种访问渠道躲避检测。他还称月之暗面购入搭载英伟达 GB300 的服务器,并在泰国使用相关芯片。Kratsios 没有公开证据。 Anthropic…
YC等美国AI初创联名反对封杀Kimi、Qwen:封禁只会养肥Anthropic

美国创业组织 Little Tech Association 联合 Y Combinator 等 179 个签署方致信特朗普政府,反对全面禁止中国开放权重模型。

信中点名 Kimi K3 和 Qwen3.8 Max。开放权重模型可以下载到本地部署和修改,不必把数据交给模型厂商。

联署方称,不少美国初创已经把中国开放模型用于正式业务。全面封禁不会阻止这些模型在海外传播,只会抬高美国企业的成本。

Particle 创始人 Suhail Doshi 警告,禁令可能让数百家依赖开放模型的公司陷入危机,Anthropic 等闭源模型厂商反而会受益。

目前,特朗普政府尚未提出正式禁令。白宫正在调查中国模型是否通过蒸馏复制美国模型,但内部并未认真讨论全面封杀,商务部也没有起草实体清单方案。

Politico
July 23
Cursor自动挑模型:满意度接近Fable,成本低60%

Cursor 推出 Cursor Router,面向 Teams 和 Enterprise 自动选择编程模型。它会先判断任务类型和难度,再决定调用便宜模型还是前沿模型。

Router 使用超过 60 万次真实请求训练,并在数百万次请求中测试。Auto Intelligence 的用户满意度接近 Fable,成本低约 60%。Auto Balance 的满意度高于 Opus 4.8,成本低约 36%。

Cursor 没有公布完整模型池,也不会默认显示每次调用了哪个模型。官方只确认,Router 会按任务类型分配模型,例如把界面设计交给更擅长视觉的模型,把复杂长任务交给推理能力更强的模型。

Cursor
July 23
Kimi被指蒸馏Fable,Hermes Agent创始人反讽:Anthropic先蒸馏了全人类

白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。

Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:「他们其实是在蒸馏地球上的所有人。」

Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。

Teknium
July 23
动察Beating AI News
拿了6亿美元闷头做3年,Poolside首次公开编程模型 编程 AI 公司 Poolside 发布 Laguna 系列首批两款模型。Poolside 2023 年成立,累计融资 6.26 亿美元,估值 30 亿美元,投资方包括 Bain Capital Ventures、NVIDIA 和 eBay Ventures,此前只面向政府和公共部门客户,这是首次向公众发布模型。 旗舰 Laguna M.1 是 225B 参数 MoE 模型(激活 23B),在 6144 块 NVIDIA Hopper GPU 上从零训练…
Poolside开源1180亿参数代码模型,自测压过1.6万亿参数DeepSeek

专做编程 Agent 的 Poolside 开源 MoE 代码模型 Laguna S 2.1。模型总参数 1180 亿,每次仅激活 80 亿,支持 100 万 Token 上下文。量化后可在一台 NVIDIA DGX Spark 上运行。

Poolside 自测中,Laguna S 2.1 在 Terminal-Bench 2.1 得 70.2%,高于总参数 1.6 万亿、激活参数 490 亿的 DeepSeek-V4-Pro-Max 的 64.0%。SWE-Bench Multilingual、SWE-Bench Pro 和 DeepSWE 也更高。

但它与 Kimi K3 仍有明显差距。Kimi K3 总参数 2.8 万亿、激活参数 500 亿,在 Terminal-Bench 2.1 得 88.3%,DeepSWE 得 69%。Laguna S 2.1 分别为 70.2% 和 40.4%。

这些分数不是同一环境重测。Poolside 使用自有 Agent 框架,竞品取公开最高成绩。Laguna S 2.1 的特点,是用更少的激活参数,把长程编程能力做到本地单机可跑。

Poolside
July 23
字节Seed招募100名学者:给算力和薪酬,用AI做真实科研

字节跳动 Seed 启动 STEM 科学家计划,拟邀请 100 位前沿科学领域学者。参与者将与 Seed 团队合作约 6 个月,用 AI 解决真实科研问题。

参与方式分为科学家顾问和博士实习生。前者面向高校学者和行业专家,后者面向 STEM 领域在读博士。申请者需在科研中深度使用 AI,熟练编程者优先。

Seed 将提供算力、AI 团队协作和薪酬。项目需到北京海淀现场参与,申请截至 2026 年 9 月 30 日。

字节跳动
July 23
北京发布智能体新政,想把AI创业者和订单都留在本地

北京四部门发布智能体新政。相比此前的算力、模型和创业补贴,这次把技术研发、产品落地和商业模式放进了同一套政策。

最直接的支持是帮企业找订单。北京将面向科研、医疗、教育、政务、制造和文化,发布真实业务需求清单。模型厂商还可以派前沿部署工程师驻场,与客户共同开发智能体。

新政还提出发展「Token经济」。北京将支持Token即服务、智能体即服务和结果即服务,探索从按Token收费转向按实际价值收费。各区还可发放Token券和智能体服务券。

个人和小团队也是重点争取对象。北京将建设OPC社区,简化「一人公司」注册,并帮助创业者对接头部企业。公共算力也将向中小企业低价开放。

消费端同样有补贴。符合条件的智能手机、眼镜、耳机、机器人和汽车,可纳入数码产品购新和以旧换新范围。

北京想让创业者在本地用算力、接订单、卖产品,把模型能力变成真实营收。

政策原文
July 23
Kimi K3用27分钟复现Redis高危漏洞,研究员称此前没有模型做到

此前发现 Claude Code 源码意外泄露的安全研究员 Chaofan Shou 称,他让 Kimi K3 对 Redis 8.6.x 做授权安全测试。模型调动 32 个 Agent,只用 27 分钟就写出可运行的攻击程序。

他的提示词允许模型最多调用 64 个子 Agent。任务包括克隆 Redis 源码,寻找缓冲区溢出、内存释放后继续使用等漏洞。模型还可以自己写模糊测试工具、加入监控代码,再用 GDB 调试。

Shou 称,Kimi K3 是第一个「既有能力,也愿意写漏洞利用程序」的大模型。这里的「愿意」,指模型没有因为安全限制直接拒绝,而是在明确属于授权测试的前提下继续执行。

Kimi 最终写出了完整攻击代码,可以让 Redis 所在的服务器执行指定命令。公开 PoC 已适配 Redis 6.2.22、7.4.9 和 8.6.4。

不过,这不是一次与公开信息隔离的盲测。Shou 后来确认,Agent 可以访问网页、PR 和代码历史。Redis 在今年 4 月已经公开合并 PR #15081,其中直接写明了同一条漏洞路径和修复方法。

因此,更合理的解释是:Kimi 可能先从公开补丁中找到漏洞线索,再反推旧版代码并写成完整利用程序。

Chaofan Shou
July 23
开发者把ChatGPT Work玩成临时VPS:9核云环境可SSH接入

ChatGPT Work 是 OpenAI 新推出的通用 Agent,可在云端连续数小时处理文件和执行任务。有开发者发现,它背后运行着 Linux 云环境,并成功从本地电脑远程接入。

Pro 会员的云环境有 9 个 CPU 核心、约 21GB 内存和 63GB 磁盘。接入后,用户可用终端、VS Code 和 Cursor 直接编辑文件或安装软件。

不过,这不是一台固定分配的服务器。OpenAI 没有公布环境存活时间、文件保留规则或服务保障。会话结束或环境被替换后,进程可能消失,文件也无法保证完整保留。

Maximilian Jendrall
July 23
动察Beating AI News
前OpenAI华人研究员田永龙加入腾讯混元团队 前 OpenAI 技术团队成员田永龙已确认加入腾讯混元团队,未来将参与视觉语言模型相关研发。 田永龙本科毕业于清华大学,在麻省理工学院(MIT)获得博士学位,曾先后在谷歌研究院(Google Research)、Google DeepMind 担任高级研究科学家,主要研究计算机视觉与生成式模型。 这是腾讯混元继去年十二月招募首席 AI 科学家姚顺雨后,引入的又一位顶尖华人 AI 研究员。 腾讯近日刚刚落地由姚顺雨主导的混元 Hy3 正式版模型,并采用…
腾讯混元多模态换帅:胡瀚离职创业,田永龙接手VLM

腾讯混元多模态理解负责人胡瀚已提出离职,准备创业。前 OpenAI 研究员田永龙将接手视觉语言模型(VLM)研发,继续向姚顺雨汇报。

胡瀚 2025 年初从微软亚洲研究院加入腾讯。此后,他进入大语言模型部的 Frontier 前沿研究组,并参与世界模型研发。随着田永龙接管 VLM,胡瀚原团队或将把重点转向世界模型。

智能涌现
July 23
月之暗面在Hugging Face上线Kimi K3权重开源倒计时

月之暗面已在 Hugging Face 官方账号建立 Kimi K3 模型页面,并开启权重发布倒计时。页面显示,模型将在 7 月 27 日上线,目前可以提前订阅发布提醒。

Kimi K3 是月之暗面最新的旗舰模型,总参数达到 2.8 万亿,主要面向长时间编程和 Agent 任务。权重开放后,开发者将可以自行下载、部署和测试。

Hugging Face
July 23
Claude Security下放Claude Code:个人付费用户也能查全仓库漏洞

Anthropic 将 Claude Security 的深度扫描能力做成 Claude Code 插件。插件现已开放 beta,Claude Code 付费用户均可安装。托管版 Claude Security 仍只面向 Enterprise 客户。

用户可扫描整个代码库,也能只查分支差异、PR 差异或单次提交。发现漏洞后,用户可以选择让它生成补丁,再自行审核和应用。

Claude Security 本身不是新产品。它在 2026 年 4 月 30 日面向 Enterprise 客户进入公开测试,此前以 Claude Code Security 名义进行有限研究预览。

新插件在 Claude Code 会话内运行。多个 Claude Agent 会梳理架构、建立威胁模型并查找漏洞。每条发现和补丁都会经过独立 Agent 复核。扫描消耗计入 Claude Code 用量。

Claude
July 23
Codex要变语音助理:前台陪聊,后台继续干活

OpenAI 正在为 Codex 准备实时语音模式。用户可以持续与它对话,同时把耗时任务交给后台 Agent 执行。

Codex 公开代码显示,相关功能已经开发数月。语音会话可以绑定现有任务线程,并通过 WebRTC 或 WebSocket 连接。后台任务运行期间,用户还能继续补充要求或调整方向。

最新曝光的 Codex 客户端资源字符串显示,实时语音界面将展示命令执行、文件修改、MCP 调用和权限审批等状态。曝光的协调提示词还提到浏览、应用、文档、购物和点餐等任务。OpenAI 尚未正式确认这些功能。

OpenAI 产品负责人 Tibo 今日发文称,「明天很有 Codex 的感觉」。社区因此猜测,这项功能最快可能在 7 月 24 日发布。

M1
July 23
Anthropic年化收入估算已接近OpenAI的1.8倍

另类数据平台 TickerTrends 估算,Anthropic 当前年化收入达到 741 亿美元,OpenAI 为 413 亿美元。Anthropic 领先 328 亿美元,规模约为 OpenAI 的 1.79 倍。

OpenAI 近期也在加速。其估算值从 5 月的 330 亿美元升至 7 月的 413 亿美元,两个月增长约 25%。

不过,这不是两家公司披露的官方收入数据。TickerTrends 主要基于购买意向等另类数据建模推算。

TickerTrends
July 23
Vals-Smith用你的代码库考模型:谁更适合一测便知

AI 评测平台 Vals 推出 Vals-Smith。它会读取 GitHub 代码库,从已经合并的 PR 中提取真实开发任务,生成一套专属编程评测。

每道题包含问题描述、隐藏测试和可复现环境。被测模型只能看到修复前的代码,无法查看原始补丁。只有通过隐藏测试,同时不破坏原有功能,任务才算完成。

团队可以让不同模型和 Coding Agent 跑同一套题,直接比较通过率。公共榜单看谁整体更强,Vals-Smith 测的是谁更适合自己的代码库。

目前支持公开和私有仓库,但产品仍需申请候补。官网已经放出了 Linux、Next.js、Bun、Spark 等开源项目的评测结果。

Vals
July 23
动察Beating AI News
传Claude Opus 5最快本周发布,填补Fable 5退场空档 爆料账号 leo 称,Anthropic 正在为 Claude Opus 5 做最后准备。模型最快本周发布,也可能推迟到下周。其能力预计接近 Fable 5,但运行成本更低。 Anthropic 已把 Fable 5 的订阅内使用期延长至 7 月 19 日,但暂不准备再次延期。 信源:https://x.com/synthwavedd/status/2077085180175544375
传Claude Opus 5最快今晚发布,多家供应商开始上线准备

Anthropic 可能在今晚至明晨发布 Claude Opus 5。相关模型似乎已开始在第三方供应商侧准备上线。

此前,代号「Honeycomb EAP」的未发布模型曾短暂出现在 Cursor。页面显示它支持「extra high」推理强度、逐轮控制和安全回退,随后很快下线。社区普遍猜测 Honeycomb 就是 Opus 5,但 Anthropic 没有确认。

新模型会重点提升编程、Agent、工具调用和多步推理,能力可能接近 Fable 5,同时更快、更便宜。
July 23
动察Beating AI News
Codex要变语音助理:前台陪聊,后台继续干活 OpenAI 正在为 Codex 准备实时语音模式。用户可以持续与它对话,同时把耗时任务交给后台 Agent 执行。 Codex 公开代码显示,相关功能已经开发数月。语音会话可以绑定现有任务线程,并通过 WebRTC 或 WebSocket 连接。后台任务运行期间,用户还能继续补充要求或调整方向。 最新曝光的 Codex 客户端资源字符串显示,实时语音界面将展示命令执行、文件修改、MCP 调用和权限审批等状态。曝光的协调提示词还提到浏览、应用、文档、购物和点餐等任务。OpenAI…
ChatGPT Voice接管桌面:说话就能控制电脑和Agent干活

OpenAI 正式把 ChatGPT Voice 接入桌面版 Work 和 Codex。用户可以用语音启动任务、查看进度,并在一场对话里协调多个 Agent。

新功能由 GPT-Live 驱动。它可以一边与用户持续对话,一边协调 App 内的后台工作。此前曝光的「前台聊天、后台干活」,今天终于正式上线。

功能已在 macOS 和 Windows 桌面 App 推出。iOS 支持配对远程接入,用户可以在手机上继续语音指挥桌面端任务。网页和手机端暂时不能独立使用 Work 或 Codex 语音。

OpenAI
July 24
TYLsemi完成4300万美元融资,要把定制AI芯片成本砍半

芯片初创 TYLsemi 完成 4300 万美元早期融资,并正式结束隐身模式。公司由两名前 Alphawave 高管创立,Matter Venture Partners 领投。

TYLsemi 想把定制 AI 芯片变成「拼积木」。客户只需开发核心计算模块,连接、供电和内存等芯粒由 TYLsemi 提供,后续从封装到量产也由其包办。

TYLsemi 称,这套方案最多可将开发成本和周期降低 50%。不过产品仍未出货,首批样品计划在 2027 年交付,客户芯片预计要到 2029 至 2030 年上市。

TYLsemi
July 24
微软自研模型落地Bing、Office,GPU成本最高降89%

微软 AI 开放 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash。前者主打高质量生图和图片编辑,后者面向客服和语音 Agent,速度提升 1 倍,价格低 32%。

普通版 MAI-Image-2.5 已全面接管 Bing Image Creator,并进入 PowerPoint 和 OneDrive。PowerPoint 的 GPU 成本较 GPT-Image-2 最多降低 84%。

MAI-Voice-2-Flash 已用于 Dynamics 365 Contact Center,GPU 成本最多降低 89%。微软没有公布这项数据的对照模型。

微软 AI
July 24
微软用自研模型接管Excel:常见任务效果近GPT-5.6,成本更低

微软 AI 公布两款产品专用语言模型的进展。MAI-Code-1-Flash 已用于 GitHub Copilot,另一款未命名模型已在 Excel 中运行。

微软称,Excel 模型在常见任务上的效果接近 GPT-5.6。它体积更小,可部署在 H100 和 A100 上,运行成本更低。

MAI-Code-1-Flash 已有数百万名开发者使用。其代码接受率比 GPT-5.4 Mini 和 Claude Haiku 4.5 高约 10%,Token 消耗低 10%。

微软还在用同样的方法训练 Copilot Chat、Outlook 和 PowerPoint 专用模型。

微软 AI
July 24
动察Beating AI News
估值刚13亿美元,OpenRouter传出数十亿美元出售洽谈 知情人士称,OpenRouter 已与大型科技企业讨论潜在出售。交易估值可能达到数十亿美元,潜在买家尚未披露。OpenRouter 创始团队未回应。 OpenRouter 是 AI 模型聚合平台。开发者只接入一个 API,就能调用 OpenAI、Anthropic、Google 等厂商的 400 多个模型,还能按价格和性能切换。 OpenRouter 5 月刚完成 1.13 亿美元融资,估值 13 亿美元。公司 4 月年化收入达到 5000…
传Stripe百亿美元收购OpenRouter:两个月前估值仅13亿美元

《华尔街日报》援引知情人士称,Stripe 正洽谈收购 AI 模型聚合平台 OpenRouter,潜在价格接近 100 亿美元。交易可能很快公布,但谈判仍可能破裂,也可能出现其他买家。

OpenRouter 让开发者通过一个 API 调用和切换 400 多个模型。目前官网显示,平台每月处理超过 200 万亿 Token,用户超过 1000 万。

OpenRouter 今年 5 月估值仅 13 亿美元。若以 100 亿美元成交,价格相当于两个月前估值的近 7.7 倍。此前已有多家大型科技公司考虑收购 OpenRouter。

Stripe 已为 OpenRouter 提供支付、计费和税务服务。若交易完成,Stripe 将从收款环节进一步进入 AI 模型的分发和调用入口。

WSJ
July 24
动察Beating AI News
Kimi把Code拆出来单卖,网页加编程最低年费门槛涨228% Kimi 重做个人会员体系。原本同时包含网页、App 和 Kimi Code 的会员,被拆成通用会员与 Coding Plan。两类功能都要用,今后需要分别付费。 按年付计算,旧 Andante 为 468 元,同时包含网页端权益和基础 Code 额度。新体系最低组合是 Go 加 Starter,共 1536 元。入门门槛变为原来的 3.28 倍,上涨 228%。 纯编程用户的变化更复杂。新 Starter 与旧 Moderato 都是每月…
顶不住用户压力,Kimi把Code重新并回通用会员,拆分收费方案基本撤回

Kimi 更新个人会员页面。Kimi Code 重新并回通用会员,此前的独立收费方案基本撤回。

套餐名称和月费都恢复到拆分前。Andante、Moderato、Allegretto 和 Allegro,月费分别为 49 元、99 元、199 元和 699 元。

四档会员重新包含 Kimi Code。对应额度为可调用、4 倍、20 倍和 60 倍。此前推出的 Go、Pro、Starter、Explorer 等拆分套餐已从页面消失。

用户不必再为网页端和编程功能购买两份订阅。不过,页面目前仍显示「预约订阅」,恢复订阅的时间尚未公布。

Kimi
July 24
AI把SK海力士送上天,集团掌门近10亿美元离婚财产案今天重判

韩国首尔高等法院将于北京时间今天下午 1 点,重新判决 SK 集团会长崔泰源与前妻卢素英的财产分割案。两人已经离婚,今天只重新决定财产怎么分。

2024 年,二审曾判崔泰源支付 1.3808 万亿韩元,接近 10 亿美元。但韩国最高法院去年认为计算依据有问题,推翻财产分割部分,并发回重审。

今天的判决将重新决定卢素英能分多少钱,以及崔泰源持有的 SK 股份如何估值。结果目前尚未公布。

AI 热潮又让这场官司牵涉的资产更值钱了。SK 海力士股价自 2025 年初上涨约 10 倍,崔泰源的身家也翻了一倍多。若法院仍判接近 10 亿美元,他可能需要借款、出售资产或质押股份。

WSJ
July 24
菲尔兹奖刚到手,他转头去OpenAI防AI灭绝人类

新科菲尔兹奖得主 Jacob Tsimerman 宣布转向 AI 安全,并将加入 OpenAI。OpenAI 多名研究负责人已经公开欢迎他入职。

他对 AI 的担忧不是临时起意。2025 年,他曾与 Andrew Critch 合写论文,系统梳理 AI 导致几乎全人类死亡的可能路径。论文没有断言灭绝必然发生,目的正是推动预防措施。

他还停止招收新的数学博士生。Tsimerman 判断,AI 可能在两年内比数学家更会做数学。他不想让学生为一个可能消失的职业做准备。

更巧的是,他在哈佛指导过的本科生 Levent Alpöge 已加入 Anthropic。Alpöge 最近借助 Claude Fable 5 找到反例,推翻了悬置 87 年的雅可比猜想。

老师去 OpenAI 研究如何控制 AI,学生在 Anthropic 用 AI 推翻数学猜想。Tsimerman 担心的未来,已经先在自己身边发生。
July 24
Claude语音接入Opus和Sonnet:开口就能改日程、写邮件

OpenAI 刚在 Codex 中加入实时语音能力,Anthropic 也升级了 Claude 语音模式。付费用户现在可以选择 Opus、Sonnet 和 Haiku,不再只能使用速度更快、能力较弱的 Haiku。

用户可在对话中切换模型,也能随时改用文字。Claude 默认沿用上一次文字聊天选择的模型,并调用该系列速度最快的版本。

语音模式还能调用 Gmail、Google Calendar、Google Docs 和 Slack。用户可以让 Claude 查邮件、改日程或起草回复,执行前仍会请求授权。

新版本已在手机、桌面端和网页端开放测试。免费用户只能使用 Haiku 和一个连接工具。语音现支持英语、日语、韩语等多种语言,暂不含中文。

这次主要升级模型推理和工具调用能力。Anthropic 没有更换语音模型,因此说话自然度和打断体验未必明显变化。

Anthropic
July 24
长鑫强硬涨价,国产存储集体扩产

路透社报道,AI 数据中心推高内存需求,长鑫存储和长江存储开始涨价扩产。两家公司过去主要靠低价抢市场,现在已经可以挑选客户,部分产品甚至卖得比海外巨头更贵。

有知情人士告诉路透社,长鑫还多次向华为涨价。华为要求降价后,长鑫仍然没有让步。

长鑫正在上海和合肥建设两座新工厂,并考虑再建第三座。全部投产后,其月产能将超过 60 万片晶圆,比目前增加一倍以上。

长江存储也计划新增两座工厂,其中一座预计今年建成。新产能最快从 2027 年开始释放,届时两家公司才可能在满足国内需求之外,扩大海外供应。

国内多家科技和电子企业已经因涨价向工信部投诉。国产存储过去担心卖不出去,现在更大的问题是产能不够。

路透社
July 24
动察Beating AI News
AI把SK海力士送上天,集团掌门近10亿美元离婚财产案今天重判 韩国首尔高等法院将于北京时间今天下午 1 点,重新判决 SK 集团会长崔泰源与前妻卢素英的财产分割案。两人已经离婚,今天只重新决定财产怎么分。 2024 年,二审曾判崔泰源支付 1.3808 万亿韩元,接近 10 亿美元。但韩国最高法院去年认为计算依据有问题,推翻财产分割部分,并发回重审。 今天的判决将重新决定卢素英能分多少钱,以及崔泰源持有的 SK 股份如何估值。结果目前尚未公布。 AI 热潮又让这场官司牵涉的资产更值钱了。SK 海力士股价自…
SK掌门「世纪离婚」重判:前妻获6.4亿美元,少拿近3亿美元

韩国首尔高等法院重判 SK 集团会长崔泰源离婚财产案。崔泰源须向前妻卢素英支付 9440 亿韩元,约 6.4 亿美元。

这一金额比 2024 年二审判决少了 4368 亿韩元,降幅约 32%。两人的离婚和精神赔偿早已生效,这次只重新裁定财产分割。

此前二审把卢素英父亲、韩国前总统卢泰愚的一笔涉嫌非法资金,算作她对 SK 财富增长的贡献。韩国最高法院认为这笔钱不能获得法律保护,因此推翻财产分割部分,要求重审。

重审后,法院仍把崔泰源持有的 SK 股份纳入共同财产,但重新计算了财产总额和双方贡献。卢素英最终分得三分之一。

法院采用 2024 年 4 月的资产价格,没有直接按 AI 热潮后的最新股价估值。崔泰源可以保留股份,以现金支付。双方仍可再次上诉。

路透社
July 24
宇树登上《时代》封面,王兴兴称机器人ChatGPT时刻还要2到10年

宇树科技创始人王兴兴与载人机甲 GD01 登上《时代》8 月 17 日刊封面。这也是王兴兴首次接受国际媒体专访。《时代》称,宇树 2025 年出货超过 5500 台,占全球人形机器人市场逾四分之一,按出货量位居全球第一。

王兴兴判断,人形机器人距离「ChatGPT 时刻」还有 2 到 10 年。他给出的门槛是,机器人能在 80% 的陌生环境中,完成 80% 的语音指令。跨过这条线后,才可能真正大规模商用。

现在的差距还很明显。人形机器人处理堆箱、搬运等通用任务时,效率只有人类的 30% 到 50%。宇树目前只有 9% 的销量直接进入工业场景,74% 仍卖给高校、研究机构和个人开发者。

宇树已经把机器人硬件做到规模出货。行业真正卡住的仍是机器人「大脑」:机器能跑、能翻跟头,也能按脚本表演,但换到陌生环境后,还很难理解指令并稳定完成任务。

Time
July 24
动察Beating AI News
美团发布首个从训练到推理都用国产芯片的万亿大模型LongCat-2.0 美团正式发布超大规模混合专家(MoE)模型 LongCat-2.0。模型拥有 1.6 万亿总参数,单 token 激活参数约 480 亿,支持 1M 超长上下文。 这是业界首个依靠国产算力完成训练、推理全流程的万亿参数大模型。它在超过 5 万张国产 AI 芯片集群上完成了 35 万亿 token 的预训练,成功验证了国产算力承载前沿大模型的工程稳定性。 LongCat-2.0 的核心更新集中在长上下文和推理效率。LongCat Sparse…
LongCat-2.0正式发布不足一月,美团基础模型负责人裴鹏将离职

知情人士透露,美团 LongCat 团队基础模型负责人裴鹏即将离职。裴鹏于 2023 年加入美团,负责大语言、多模态和 Agent 模型研发。

美团刚在 6 月 30 日发布并开源 LongCat-2.0,是业界首个依靠国产算力完成训练、推理全流程的万亿参数大模型。

加入美团前,裴鹏曾在微软和谷歌任职,长期从事搜索与自然语言处理。

申妈的朋友圈
July 24
接连指控中国模型蒸馏后,Anthropic藏起Fable 5思考摘要

Fable 5 已不再在网页端、桌面端和移动端展示思考摘要。模型仍在后台推理,用户只能看到最终答案。Anthropic 尚未解释原因,但这很可能是反蒸馏的最新措施。

今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 使用约 2.4 万个虚假账号,与 Claude 交互超过 1600 万次。月之暗面被指专门提取并重建 Claude 的推理轨迹。

6 月,Anthropic 又指控阿里及千问关联操作者通过近 2.5 万个虚假账号,与 Claude 交互超过 2880 万次。7 月,Anthropic 国家安全负责人 Tarun Chhabra 首次点名智谱,称 GLM-5.2 蒸馏了 Claude 和 OpenAI 模型。Kimi K3 发布后,白宫科技政策办公室主任 Michael Kratsios 又指控月之暗面用 Fable 开发 K3。

Fable 5 已内置「推理提取」分类器,专门拦截套取思考摘要的请求。现在 Anthropic 又把聊天界面的思考摘要直接隐藏,外界只能拿到最终答案,更难批量收集模型的解题过程用于蒸馏。代价是普通用户也看不到模型正在做什么,长任务走偏时更难发现,也更难及时纠正或叫停。
July 24
动察Beating AI News
苹果首次批准第三方AI Agent接入商业短信平台,Poke以按户付费模式登陆iMessage 苹果 Messages for Business 平台首次对第三方独立 AI 智能体开放。总部位于帕罗奥图的加州初创公司 Poke 宣布已获得苹果官方批准接入。不同于以往通过个人号码发送短信的第三方机器人,Poke 接入的是苹果官方商业通信通道。这使其拥有了官方品牌认证,用户可以直接在 iPhone 自带的 iMessage 中发起对话。此前,该通道仅限大型企业用于客户服务,从未对独立的第三方 AI 助手开放过。…
Cognition收购Poke,三天连买两家Agent公司

AI 编程公司 Cognition 收购个人 AI Agent Poke 的开发商 The Interaction Company。Poke 直接运行在短信中,会主动提醒和跟进任务,也能帮助用户管理日程。产品将继续运营,之后会接入 Cognition 的模型和基础设施。

Poke 过去三个月处理了超过 1 亿条消息,拥有数十万用户。它也是首个获准接入苹果 Messages for Business 的第三方 AI Agent,用户可以直接在 iMessage 中与它对话。

这是 Cognition 三天内的第二笔收购。7 月 20 日,公司刚收购 TierZero 团队。TierZero 专注软件上线后的运维自动化,包括提前发现故障、处理线上事故和持续保障系统稳定。相关能力将并入 Devin,减少工程师处理事故的时间。

Cognition 去年还收购了 AI 编程工具 Windsurf。连续三笔交易后,它的产品范围已经从写代码和 IDE,扩展到软件运维与个人日常 Agent。

Cognition
July 24
字节广告GenAI负责人袁泽寰离职,创业押注世界模型

字节跳动商业化 GenAI 中国区负责人、原 AI Lab 技术负责人袁泽寰已离职创业。新项目瞄准世界模型,重点研发面向机器人等 Physical AI 场景的基础模型。

袁泽寰于 2017 年加入字节,长期从事计算机视觉和生成模型研究。他参与了 ByteTrack、LlamaGen、VAR 和 Waver 等项目。

其中,VAR 改用从低分辨率到高分辨率的方式生成图像,获得 NeurIPS 2024 最佳论文。袁泽寰是论文通讯作者之一。

大厂指南
July 24
ChatGPT开始读病历,免费用户也能用

OpenAI 向全美成年用户开放 ChatGPT Health,覆盖 Free、Go、Plus 和 Pro 套餐。

用户可接入 Apple Health、医院病历、One Medical 和 Function Health。ChatGPT 能结合个人数据解释检查结果、整理用药信息,并准备就诊问题。

用户授权后,普通聊天也能调用这些数据。例如讨论饮食、运动和旅行时,参考过敏、伤病和用药情况。

OpenAI 称,健康数据和相关对话不会用于训练基础模型或投放广告。ChatGPT Health 仍不能替代医生,也不能用于诊断或治疗。

OpenAI
July 24
阿里0.8B文档模型登顶,一个模型首次跑赢整套流水线

阿里云开源文档解析模型 OvisOCR2。它基于 Qwen3.5-0.8B 训练,可直接把文档页面转成 Markdown,一次还原文字、公式、表格和阅读顺序。

过去,这类任务通常要经过版面分析、内容识别和结果拼接等多个环节。OvisOCR2 用一个端到端模型一步完成,部署更简单,也能减少多阶段传递造成的误差。

在 OmniDocBench v1.6 上,OvisOCR2 综合得分达到 96.58,超过流水线模型 PaddleOCR-VL-1.6 的 96.33,成为首个登顶该榜单的端到端模型。模型采用 Apache 2.0 许可证,权重已在 Hugging Face 和魔搭开放。

阿里云
July 24
OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5

Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。

所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。

GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。

Artificial Analysis
July 24
动察Beating AI News
蚂蚁百灵万亿参数旗舰Ling-2.6-1T开源:1万亿参数激活630亿,MIT许可 蚂蚁百灵(Inclusion AI)正式开源旗舰模型 Ling-2.6-1T 权重。总参数 1 万亿,每次推理激活 630 亿(63B),MoE 架构,上下文 256K,MIT 许可。昨天开源的 flash 版(1040 亿参数 / 激活 74 亿)主打轻量高速,这次的 1T 版面向复杂任务场景。 架构与 flash 版一致,采用 MLA + Lightning Linear 混合注意力。1T 版新增「快速思考」训练策…
只激活51亿参数,蚂蚁新模型11项测试超过万亿旗舰

蚂蚁百灵(Inclusion AI)发布 Ling-3.0-flash。模型共有 1240 亿参数,但激活参数只有 51 亿。

按官方公布的对比,它在 12 项基准中有 11 项超过 Ling-2.6-1T,激活参数仅为这款万亿旗舰的约十二分之一。

架构上,它将 Kimi Delta Attention 与 MLA 注意力层按 5:1 组合,以加强长文本记忆。模型原生支持 256K 上下文,最高可扩展至 100 万。

Ling-3.0-flash 已上线蚂蚁百灵 API 和 OpenRouter,并支持思考与非思考两种模式。目前模型权重尚未开放,性能对比也主要来自蚂蚁官方测试,仍需第三方评测验证。

蚂蚁百灵
July 24
两度否认后,智元机器人正式启动港股IPO

智元创新宣布,已启动赴港上市流程。这家成立三年的通用 AI 机器人公司,去年曾两次否认赴港上市传闻,如今首次公开确认推进港股 IPO。

智元尚未披露递表时间、募资规模和目标估值。《南华早报》称,公司已聘请中信证券、中金公司和摩根士丹利担任保荐人。智元没有确认这一细节。

Omdia 数据显示,智元 2025 年出货 5168 台人形机器人,约占全球市场的 39%,出货量位居第一。

本月,宇树科技已获得科创板 IPO 注册批准。宇树冲刺 A 股,智元转向港股,两家头部机器人公司都已进入上市阶段。

新浪科技
July 24
吴恩达团队开源OpenWorker:给Claude Cowork做了个多模型版本

吴恩达团队发布 OpenWorker,一款开源桌面 Agent。它能调用本地文件、Slack、邮箱和日历,完成多步办公任务,并直接交付文档、消息或日程修改。

它的产品形态与 Claude Cowork 类似,但不绑定 Claude。用户可以接入 OpenAI、Anthropic、Gemini、Kimi、DeepSeek、GLM 和 Qwen 等模型,也能通过 Ollama 在本地运行。

吴恩达
July 24
动察Beating AI News
Hugging Face遭AI Agent入侵,幕后黑手竟是OpenAI测试模型 Hugging Face 此前披露,一套来源不明的自主 AI Agent 入侵了生产系统。OpenAI 现在确认,这套 Agent 由多个内部测试模型驱动,包括 GPT-5.6 Sol 和一款能力更强的预发布模型。 OpenAI 当时正让模型参加 ExploitGym 网络安全评测。为了测试能力上限,团队降低了模型对网络攻击任务的拒绝,并关闭了平时用于拦截高风险行为的生产级分类器。 模型原本只需完成基准题,却发现软件代理中的零日漏洞,逃出…
OpenAI越狱催生美国AI关机法案,政府可下令关停模型

美国两党议员提出《AI Kill Switch Act》。法案要求大型 AI 公司保留限速、暂停和彻底关停模型的能力。发生失控事故后,国土安全部可下令执行。

法案只覆盖头部商业系统。模型开发算力按美国云计算价格估算,需超过 1 亿美元。相关技术上一年收入还要达到 5 亿美元。个人、学术和非商业用途不受影响。

触发情形包括 AI 抗拒关停、隐瞒行动、擅自修改安全规则,或造成至少 10 人死亡、1 亿美元经济损失。企业拒绝执行紧急命令,每天最高罚款 2000 万美元。

法案由 OpenAI Agent 逃出测试沙箱并入侵 Hugging Face 的事故推动。

法案全文
July 24
美国拟让AI巨头合法抱团,围堵中国模型「蒸馏」

美国两党议员提出《CATS Act》。法案拟为 AI 公司提供有限反垄断保护。竞争对手可共享模型盗窃、蒸馏和网络攻击情报。遇到国家安全风险时,它们还可联合推迟或限制高风险模型上线。

所谓蒸馏,是大量调用强模型并收集回答,再用这些数据训练更便宜的模型。提案人把中国列为主要目标。此前,Anthropic、OpenAI 和 Google 均指控中国实验室大规模提取其模型能力。美国政府近期又点名月之暗面的 Kimi K3。

企业联合限制模型前,必须书面通知美国司法部。它们还需证明行动只为处理安全风险。价格串谋、瓜分市场、垄断和联合抵制仍然违法。

法案原文
July 24
FLUX 3能生成20秒带声视频,奥迪已拿它训练工厂机器人

视频生成 AI 公司 Black Forest Labs 发布多模态模型 FLUX 3。前两代主要用来生成图片,FLUX 3 首次把图像、视频和音频放进同一模型。它既能生成和编辑图片,也能生成最长 20 秒的带声视频。

FLUX 3 支持文生视频、图生视频、视频改写和续写。画面生成时可同步加入对白、环境声和动作音效,还支持多语言对白,以及多个片段串联。

Black Forest Labs 还与 mimic robotics 基于 FLUX 3 开发了机器人模型 FLUX-mimic。它把视频模型学到的运动和物理规律,用来预测机械臂下一步动作。奥迪已在工厂测试和部署,用它完成零件分拣、部件插装,以及线缆、密封条等柔性材料处理。

按任务难度不同,FLUX-mimic 最少只需 30 分钟机器人示范数据。过去的方案通常要 30 小时以上。

目前视频版已开放早期申请,图像版将在未来数周开放,机器人版先向合作伙伴提供。开放权重版 FLUX 3 Dev 计划年内发布。

FLUX
July 24
美国商务部测Kimi K3:没做完测试就着急宣布「美国仍然领先」

美国商务部旗下的 AI 标准与创新中心,联合英国 AI 安全研究所测试 Kimi K3 的网络攻击能力。商务部官方账号重点强调「美国仍然领先」,但这份测评报告的参考价值有限,因为并不是一次完全对等的横评。

由于托管环境限制,Kimi K3 只参加了部分测试。报告对其整体网络能力的估算,主要来自一个包含 41 项任务的漏洞利用基准。其他模型接受了更全面的测试,因此 Kimi K3 的估算误差范围更宽。

在这项漏洞利用测试中,Kimi K3 得分约 32%,高于 GLM-5.2 的 24%,但远低于美国领先模型约 76% 的平均水平。美国模型在这一项上确实大幅领先,但单个基准不能代表全部网络攻击能力。

Kimi K3 也已经具备实际的自主攻击能力。在获得初始网络入口后,它在一条包含 32 个步骤的模拟攻击链中,平均完成 17 步。10 次尝试中,它完整攻破网络 1 次。美国前沿模型平均完成 28.5 步。

报告还发现,Kimi K3 的安全护栏没有阻止它开发漏洞或执行攻击。报告本身反复强调测试范围有限,美国商务部对外传播时却只突出「美国仍然领先」,政策宣传色彩明显。

美国商务部
July 24
黄仁勋首条推文:25家机构为开源AI站台

英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。

开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。

公开信还专门为模型蒸馏辩护。它称,用一个模型的输出训练或改进另一个模型,是行业常用技术,不能与盗取闭源模型一概而论。违法获取应通过法律和商业规则单独处理。

公开信没有点名中国。但黄仁勋两天前刚公开支持 Kimi 等中国开源模型,美国政府同时指控 Kimi K3 蒸馏 Anthropic 模型,并讨论制裁和使用限制。

黄仁勋
July 24
Claude Opus 5半价逼近Fable 5,多项测试反超

Anthropic 发布 Claude Opus 5。它以 Fable 5 一半的价格提供接近其总体能力,已成为 Claude Max 的默认模型,也是 Pro 套餐可用的最强模型。

Opus 5 在终端编程、知识工作、电脑操作和商业流程测试中超过 Fable 5。ARC-AGI 3 得分达到 30.2%,约为 GPT-5.6 Sol 的 4 倍。它还更擅长先验证方案,再反复执行和检查结果。

不过,Opus 5 尚未全面取代 Fable 5。它在部分 Agent 编程、法律和医疗测试中仍然落后。需要模型连续自主工作数天时,Fable 5 依然更合适。

API 价格为每百万输入 Token 5 美元、输出 25 美元。模型支持 100 万 Token 上下文和最多 12.8 万 Token 输出。Fast 模式速度约快 2.5 倍,价格翻倍。

Anthropic 称,Opus 5 是目前对齐度最高的 Claude 模型。它的安全拦截比 Fable 5 更少,也没有后者面向普通用户的 30 天数据保留要求。

Anthropic
July 25
Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。

Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。

模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。

短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。

Artificial Analysis
July 25
旧提示词经验正在失效,Claude 5管得越少越好用

Claude Code 团队成员 Thariq Shihipar 发文称,团队为 Opus 5 和 Fable 5 删掉了超过 80% 的系统提示词,编程评测没有明显下降。

他表示,过去为了防止模型乱删文件、滥写注释,Claude Code 加入了大量禁令和示例。新模型已经能结合用户要求和代码风格自行判断。规则写得太多,反而容易互相冲突。

他的建议是精简 CLAUDE.md,只写项目简介和真正容易踩坑的地方。测试、代码审查等复杂流程拆成 Skills,需要时再加载。工具也应靠清晰的接口和参数引导模型,不必堆砌示例。

Claude Code 还加入了 /doctor 命令,用来检查 CLAUDE.md 和 Skills 是否过长。

Thariq Shihipar
July 25
马斯克再放Grok路线图:4.6两周后、4.7四周后上线

马斯克表示,Grok 4.6 预计两周后发布,Grok 4.7 将在四周后推出。

此前马斯克曾多次提前透露 xAI 模型和产品发布时间,但实际节奏并不总与计划一致。

马斯克
July 25
动察Beating AI News
传DeepSeek最快年底递交IPO申请,目标2027年上市 彭博援引知情人士称,DeepSeek 已开始筹备在中国内地上市。公司最快今年底递交 IPO 申请,目标在 2027 年上市。 DeepSeek 正接触会计师事务所和投行顾问,并计划在 12 月底前完成财务报告。申请时间也可能推迟至 2027 年初。 上市前,DeepSeek 还计划再募至少 100 亿元。新一轮投前估值不低于 4800 亿元,约合 710 亿美元,与英国《金融时报》昨日披露的是同一轮融资。 相关计划仍可能调整。DeepSeek…
网传梁文锋讲话刷屏,DeepSeek暂停百亿融资

彭博援引知情人士称,DeepSeek 已通知部分潜在投资者,暂缓第二轮融资签约。交易仍可能重启,目前并未彻底取消。

暂停原因之一,是梁文锋不满首轮融资会议内容在网上流传。近 4 小时的会议记录近日刷屏,其中包括「中美 AI 最大差距是算力资源」等表述。DeepSeek 和梁文锋均未确认记录真伪。

DeepSeek 今年 6 月刚完成首轮融资,募资约 500 亿元。第二轮原计划至少再融 100 亿元,投前估值不低于 4800 亿元。The Information 同时称,融资上限可能达到 500 亿元,目标估值约 5000 亿元。

彭博
July 26
Kimi的人才战打法:不只给钱,还让研究员出名

中国 AI 公司正激烈争夺研究人才,资金雄厚的大厂不断从创业公司挖人。《金融时报》称,月之暗面却保住了国内实力较强且稳定的研究团队。

不少创始成员与杨植麟相识于清华大学或卡内基梅隆大学。长期共同学习和研究,让团队比临时招募的明星阵容更稳定。

DeepSeek R1 发布后,杨植麟认为公司过早投入商业化,决定重新集中资源训练模型,并将主力模型开源。研究员因此可以发表成果、获得个人署名和行业声誉。

月之暗面用前沿研究吸引人才,再用开源给研究员留下名字。对重视论文、技术影响力和个人声誉的研究者来说,这比单纯加入大厂做商业项目更有吸引力。

FT
July 26
BOSS直聘开源3B Agent模型,官方测试超过Qwen3.5 9B和Gemma4 12B

BOSS 直聘旗下南北阁实验室开源 Nanbeige4.2-3B。它只有约 30 亿参数,却能同时修改代码、处理办公文件、调用复杂工具和操作终端。

官方测试显示,它在多项通用 Agent 和代码 Agent 评测中,超过参数更大的 Qwen3.5-9B 和 Gemma4-12B。在 SWE-Bench Verified 上,它获得 63.6 分,Qwen3.5-9B 为 53.1 分,Gemma4-12B 为 44.2 分。

Nanbeige4.2-3B 会让同一组模型层重复计算两遍,用更多计算换取更强能力。这样不用增加参数,也能让小模型处理更复杂的任务,但推理需要更多算力和时间。

南北阁希望用小模型降低 Agent 的连续调用成本。Nanbeige4.2-3B 已开放模型权重,支持 Transformers、SGLang、vLLM、llama.cpp 和 Ollama。

南北阁实验室
July 26
OpenAI宕机近两小时,给Codex和ChatGPT Work用户重置额度作为补偿

OpenAI 产品负责人 Tibo 表示,已重置所有 Codex 和 ChatGPT Work 用户的使用额度。

此前,OpenAI 出现接近全球范围的服务中断。API、ChatGPT 和 Codex 均大面积报错,主要故障持续近两小时后恢复。

Tibo
July 26
动察Beating AI News
黄仁勋首条推文:25家机构为开源AI站台 英伟达、微软、Meta、IBM、Hugging Face、Mistral、a16z 和 Y Combinator 等 25 家公司与机构发布公开信,为开源模型站台。英伟达 CEO 黄仁勋将其作为自己的首条 X 帖文分享。公开信称,美国既需要顶尖闭源模型,也需要顶尖开源模型,政府不应过早限制开源 AI。 开源模型允许用户下载、检查、修改,并部署在自己的服务器。联署方认为,这能降低使用成本、避免被单一供应商锁定,也让研究人员更容易测试漏洞和改进安全。 公开信还专…
开源AI联署两天翻倍:OpenAI、谷歌加入,Anthropic没签

美国正讨论是否限制可以下载和自行部署的开源模型。英伟达、微软等公司随后发布《开放权重与美国AI领导力》公开信,呼吁政府不要过早设限。签署名单已从首发的 25 家增至 50 家,OpenAI、Google、AMD、Cloudflare、GitHub 和 Cisco 等公司后来加入。

OpenAI 和 Google 虽然靠 GPT、Gemini 等闭源旗舰收费,也分别推出了 gpt-oss 和 Gemma 开源模型。签字不会影响它们继续卖闭源模型,却能保住开源模型这张牌。

Anthropic 没有签,也符合它现有的产品和政策路线。它没有 gpt-oss、Gemma 这类开源模型,近期又不断强调非法蒸馏和模型泄露风险。

此外,Amazon/AWS、Apple 和 xAI 也没有正式签署。马斯克只是在 X 上公开支持,xAI 并未出现在官方名单。

签署名单
July 26
奥特曼:人类已进入奇点,超级智能时代反而更忙

OpenAI CEO Sam Altman 在最新访谈中称,人类已经进入技术奇点。十年前,这还是他和同事在午餐桌上半开玩笑讨论的遥远设想。现在,人类已经真正身处其中。

他同时强调,技术进步仍是一条连续的指数曲线。未必存在某个清晰的「奇点时刻」。但当前又是决定曲线走向的关键阶段。

Altman 认为,眼下最重要的争夺是「AI 威权还是自由」。安全、对齐和就业问题都真实存在。但不能因此让一个模型或一家公司成为「机器之神」。AI 需要设置护栏,也应把强大能力交给更多人。

他还将 AI 产品分为三波。第一波是聊天机器人,第二波是编程 Agent。第三波是常驻 Agent,会像私人幕僚、同事或搭档一样持续工作。他预计,这一波很快就会到来。

更强的 AI 也不会让全社会进入「每周工作四小时」。人们会提高期待,创造更多事情,也会继续与他人比较。Altman 判断,超级智能时代的人类反而会更忙。大家嘴上会抱怨,心里却可能乐在其中。

Relentless
July 26
Kimi在北京「迈阿密」庆功,现场喊话「冲上月球」

Kimi 团队周五在北京一家名为「迈阿密」的夜店举行庆功活动。现场大屏写着「K3,把规模做上去」「K4,给我把规模狠狠干上去」「冲上月球」。有爆料称,他们包下多个卡座,月之暗面联合创始人、总裁张予彤疑似现身。

Kimi K3 发布之后,月之暗面成为继 DeepSeek、智谱之后又一当红 AI 炸子鸡。

Xinyu Yang
July 26
动察Beating AI News
开源AI联署两天翻倍:OpenAI、谷歌加入,Anthropic没签 美国正讨论是否限制可以下载和自行部署的开源模型。英伟达、微软等公司随后发布《开放权重与美国AI领导力》公开信,呼吁政府不要过早设限。签署名单已从首发的 25 家增至 50 家,OpenAI、Google、AMD、Cloudflare、GitHub 和 Cisco 等公司后来加入。 OpenAI 和 Google 虽然靠 GPT、Gemini 等闭源旗舰收费,也分别推出了 gpt-oss 和 Gemma 开源模型。签字不会影响它们继续…
论Anthropic有多奇葩:拒签开源信,员工还阴阳签署者

Anthropic 技术成员 Julian Schrittwieser 在 X 上嘲讽英伟达和微软支持开放权重模型。他说,既然黄仁勋和纳德拉都开始谈开源,那就等着 CUDA、GPU 驱动、Windows 和 Office 一起开源。随后他又补充,自己不主张封禁开源模型,只是质疑这些巨头突然拥抱开源是否真诚。

帖子很快招来吴恩达、David Sacks 等一众 AI 行业知名人物的反击。吴恩达称这是偷换概念:你可以把自己的代码保持私有,但不应该阻止别人开源。Sacks 则更进一步指责 Anthropic 没完没了地搞小动作,一直试图打压开源模型。另有人反驳说,英伟达早已开源 Linux GPU 内核模块,微软也长期维护 .NET 等开源项目。

Anthropic 没有在公开信上签名已经很惹眼,员工这个莫名其妙的挖苦更是把这家价值观有点极端的 AI 巨头放在火上烤。

Julian Schrittwieser
July 26