🔦 今日速览
9月1日,Anthropic发布Claude Fable 5.1/Mythos 5.1,缓存读取降价75%;John Ternus接任苹果CEO,9月9日将发折叠屏iPhone;欧盟将ChatGPT列为首个”超大型在线搜索引擎”。国内,腾讯混元Hy4轻量版把1.5TB压至214GB开源,讯飞星火开源百万Token端侧模型。
趋势1:模型降价提效成主旋律
趋势2:AI战略成巨头换帅考题
趋势3:模型压缩助推旗舰上端侧
🌍 国际动态
1. Anthropic发布Claude Fable 5.1与Mythos 5.1,缓存读取成本暴降75% ⭐
事件简述:9月1日,Anthropic发布Claude Fable 5.1与Claude Mythos 5.1。Fable 5.1面向通用任务,在代理式科研基准上的表现较上一代提升超一倍,更擅长长时间、高复杂度的编程与科研任务;Mythos 5.1是放宽安全护栏、仅限经过验证的网络安全与生命科学场景使用的同款模型。
关键数据:缓存读取价格从每百万Token 1美元降至0.25美元(降75%),输入/输出价格维持 10/50美元;典型工作负载有效成本下降约 25%,高智能体负载最多降 45%;上下文窗口 100万Token。
影响分析:缓存读取是智能体反复调用同一上下文的核心成本项,Anthropic用”降价换智能体渗透”,直接瞄准与OpenAI、谷歌的Agent竞争,把前沿模型的算力经济性拉到新台阶。
📅9月1日
2. John Ternus正式接任苹果CEO,折叠屏iPhone发布进入倒计时
事件简述:9月1日,John Ternus正式接任苹果CEO,结束Tim Cook长达15年的任期;Cook转任董事会执行主席。Ternus是苹果老牌硬件工程负责人,2001年加入,自2021年起执掌硬件工程。
关键数据:苹果市值约 4万亿美元;Ternus上任后的首个大考是 9月9日产品发布会,预计发布首款折叠屏iPhone及带摄像头的AirPods、智能眼镜、机器人家庭显示屏等AI硬件。
影响分析:苹果在生成式AI上落后于微软、谷歌和OpenAI,换帅让”AI战略”从遗留问题升级为新CEO的核心考题——能否把硬件帝国变成真正的AI助理平台,将决定苹果下一个十年。
📅9月1日
3. Anthropic与Lambda签下350亿美元云计算协议,补算力缺口
事件简述:9月1日,据《华尔街日报》报道,Anthropic与英伟达投资的云计算公司Lambda签署350亿美元云算力协议,为Claude上线更多英伟达芯片。英伟达将持有得州Nueces县Hut 8数据中心的租约,Lambda负责部署芯片。
关键数据:协议金额 350亿美元;此前Anthropic已签 450亿美元 Nscale合同与 100亿美元 Volta协议,正全力填补算力供给缺口。
影响分析:Anthropic连签三笔巨额算力订单,凸显前沿实验室对算力的饥渴;英伟达以”持有租约”方式更深介入neocloud生态,把算力供应链每一环都攥在自己手里。
📅9月1日
4. 欧盟将ChatGPT列为首个”超大型在线搜索引擎”
事件简述:9月1日,欧盟委员会宣布ChatGPT被正式认定为《数字服务法案》(DSA)下的”超大型在线搜索引擎”(VLOSE),成为首个获此认定的AI聊天机器人;同时Reddit与Roblox被列为”超大型在线平台”(VLOP)。三者均须在4个月内完成合规。
关键数据:ChatGPT搜索在欧盟月活用户约 1.59亿,远超 4500万认定门槛;ChatGPT全球周活跃用户已超 10亿。
影响分析:生成式AI产品首次被纳入DSA搜索引擎监管框架,ChatGPT的内容审核、透明度与算法问责义务大幅升级,也为全球AI监管树立”AI=搜索引擎”的立法先例。
📅9月1日
🇨🇳 国内动态
1. 腾讯混元Hy4 preview轻量版开源:1.5TB压缩到214GB ⭐
事件简述:9月1日,腾讯混元发布Hy4 preview轻量版,将8月28日开源的770B旗舰MoE模型权重从约 1.5TB压缩至214GB(压缩率86%),并同步开源量化GGUF与代码。模型上线Hugging Face与GitHub,支持llama.cpp、vLLM、SGLang等框架。
关键数据:总参数 770B、激活参数 49B、上下文 100万Token;自研Sherry稀疏三值量化把路由专家层压至平均 1.25 bit,MIX-STQ1_0混合精度按敏感度逐层分配位宽;MCP Atlas得分83.7→83.2、SWE-Bench multi 82.9→81.3,能力几乎无损失。
影响分析:214GB意味着单机多卡甚至异构设备即可本地运行旗舰级模型——腾讯演示了4090笔记本+四卡A4000服务器异构联合推理达1.02 token/s,为”旗舰大模型下放端侧/私有化”提供了可行范式。
📅9月1日
2. 讯飞星火X2.5双子星开源:端侧模型首次原生支持百万Token
事件简述:9月1日,科大讯飞旗下”词元星火”开源星火X2.5-4B与X2.5-1.7B两款端侧大模型,成为端侧模型里首批原生支持100万Token长上下文的模型,权重、代码、部署文档全部公开,训练全程跑在国产算力集群上。
关键数据:1.7B版本在智能家居测试集指令执行正确率 90.3%、响应仅 0.85秒;4B版本代码能力可对标参数高 2-3倍的云端模型;兼容英伟达、华为、海光、后摩硬件。
影响分析:百万Token上下文下放到端侧,意味着手机、机器人、本地办公设备能完整消化整本文档,是”AI走出云端、跑在终端”的关键一步;9月7日讯飞还将发布云端旗舰星火X2.5。
📅9月1日
3. MiniMax股价累计涨超20%,机构称9-10月或推3万亿参数M3Pro
事件简述:8月31日以来,港股AI独角兽MiniMax股价累计上涨超20%。催化来自H3 Max视频生成模型速度跃升(5秒768P音视频生成缩至3秒内)与商业化超预期:上半年收入 1.17亿美元(同比+283.1%),8月ARR突破 8亿美元。
关键数据:7月Token消耗量达1月的 20倍;B端企业/开发者业务贡献约 80% ARR,客户规模突破 200万;多家机构研报预计9-10月推出 3万亿参数 M3Pro旗舰模型。
影响分析:从”以模型论英雄”到”看商业化兑现”,MiniMax的反弹印证国产大模型正进入规模化变现验证周期;3万亿参数M3Pro若能如期落地,将是国产模型参数规模的新纪录。
📅8月31日
📄 今日论文
1. Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
作者:Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu et al.
核心贡献:研究大推理模型(LRM)在人类监督逐步退出学习回路后如何持续提升——探讨RLVR从数学/代码扩展到开放、智能体任务时,可靠奖励缺失与人类监督无法跟上模型生成经验规模的矛盾,提出迈向超智能的路径。
为什么重要:当人类标注速度追不上模型进化,如何设计”可自监督的奖励”是通往下一代推理模型的核心工程问题。
📄 arXiv:2608.31075 📅8月31日
2. Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization
作者:Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang et al.
核心贡献:指出基于结果的强化学习把轨迹级优势均匀分配给所有决策,在长程交互中信用分配过于粗糙;提出在智能体策略优化中调和”过程监督”与”结果信用”,让每个动作获得更精细的贡献归因。
为什么重要:智能体长程任务的最大痛点是”哪一步做对了/错了”,该工作直接改进RL训练的信用分配,有望提升Agent的训练效率。
📄 arXiv:2608.31077 📅8月31日
3. SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies
作者:Weiqi Wang, Zhi Li, Yudong Lei, David Martinez et al.
核心贡献:提出”语义统一程序”(SUN Programs)——一种类型化可执行体,把几何/接触关系定义一次后,同时编译为MPC成本、满意度谓词、RL奖励、转移守卫与诊断,弥合模型控制与学习策略之间的鸿沟。
为什么重要:为”控制到学习到真机”的长程机器人操作提供统一接口,减少奖励手工设计,加速机器人策略落地。
📄 arXiv:2608.31167 📅8月31日
4. Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents
作者:Le Chen, Zishen Wan, Baixi Sun, Xiaolong Ma et al.
核心贡献:在55条编码智能体轨迹上系统研究”智能体工作记忆”的异质性——指令、产物、工具输出、智能体状态等对象在保留与压缩特性上差异显著,提出记忆管理应先”度量”后”治理”。
为什么重要:上下文窗口有限,编码智能体必须选择性遗忘,该工作为记忆管理机制的设计提供了量化依据。
📄 arXiv:2608.31057 📅8月31日