🔦 今日速览
周末过后首个交易日,AI圈消息相对平静但暗流涌动。评测机构Artificial Analysis发布智能指数v4.2,回应"Astra进展未被基准捕捉"的质疑——GPT-6 Astra评分上调4分,但仍屈居Claude Fable 5.1之后,私有测试集权重提至40%以抗"刷分"。资本侧,英伟达洽谈投资Thinking Machines Lab(约25亿美元)与Nscale(约20亿美元),延续"从闭源巨头转向算力生态"的布局;存储环节美光拟年底将HBM产能翻倍,全力供应英伟达Vera Rubin平台。国内,龙版传媒"AI漫剧"信披前后不一,遭上交所监管警示,为AI概念炒作降温。
趋势1:模型评测进入"防刷分"时代 趋势2:算力投资与内存供给双向加码 趋势3:AI概念炒作监管收紧
🌍 国际动态
1. Artificial Analysis发布智能指数v4.2,GPT-6 Astra评分上调仍不敌Fable 5.1 ⭐
事件简述:评测机构Artificial Analysis发布智能指数4.2版,回应此前"基准未能体现GPT-6 Astra实际进展"的批评。更新后Anthropic的Claude Fable 5.1仍居榜首,GPT-6 Astra较前代GPT-5.6 Sol高出4分(此前两者并列第二),Meta凭Muse Spark 1.3位列第三,其后依次为SpaceXAI、月之暗面/Kimi、智谱(Z.AI)与谷歌。新指数把私有测试集权重提升至40%,并新增两项基准,以降低"刷分"可能。 关键数据:Astra较Sol+4分;私有测试集权重提至40%;Astra是前沿模型中Token效率最高者,而Fable 5.1与Gemini 3.8 Flash耗Token最多;"单任务成本"帕累托前沿由Anthropic、OpenAI、Meta、智谱四家共享。 影响分析:在前沿模型能力趋同、跑分可信度受质疑的背景下,评测机构开始主动迭代方法论防御"刷分",模型竞争从"参数/跑分"转向"真实任务成本与Token效率",评测标准本身成为新的竞争场。 📅9月4日
2. 英伟达洽谈投资Thinking Machines Lab与Nscale,算力投资转向算力生态
事件简述:据9月5日美股披露信息,英伟达正洽谈向Mira Murati创立的Thinking Machines Lab投资约25亿美元,并向AI云服务商Nscale投资约20亿美元。这一动向延续了黄仁勋今年的表态——随着OpenAI、Anthropic相继上市、私募投资窗口关闭,英伟达已基本停止对这两家闭源巨头的追加出资,转而把资本投向其算力生态内的新兴玩家,既锁定芯片订单、又分享成长红利。 关键数据:Thinking Machines Lab拟获投约25亿美元(其累计融资已超20亿美元、估值达百亿美元级);Nscale拟获投约20亿美元(此前披露与Anthropic签下450亿美元算力协议)。 影响分析:英伟达的"投资即获客"策略正从头部大模型厂商下沉到算力云与新兴实验室,通过绑定Vera Rubin等下一代平台的算力需求,进一步巩固其在整个AI基础设施层的主导地位。 📅9月5日
3. 美光拟年底将HBM产能翻倍,加码英伟达Vera Rubin平台
事件简述:存储芯片巨头美光计划到2026年底将高带宽内存(HBM)产能提升约一倍,月产量目标约10万片晶圆,并大幅提高面向英伟达Vera Rubin AI平台的12层堆叠HBM4产出,以满足AI服务器对高带宽内存的爆发式需求。受此提振,美光9月5日收涨6.1%,存储芯片股集体走强(闪迪涨近12%)。 关键数据:HBM月产能目标约10万片(年底翻倍);12-Hi HBM4面向Vera Rubin平台;此前已披露2026年二季度全球DRAM市场规模1470.24亿美元、环比+55.9%创历史新高。 影响分析:HBM4正在成为下一代AI芯片(Vera Rubin)的关键供给瓶颈,美光从"第三名追赶者"向主力供应商跃迁,存储环节的价值正随AI推理时代而重估,算力竞争的上半场从GPU延伸到内存。 📅9月5日
4. 西雅图时报与Newsday起诉OpenAI和微软,版权诉讼潮再添两员
事件简述:西雅图时报公司与Newsday于9月4日向纽约南区联邦法院联合起诉OpenAI与微软,提交38页诉状,指控两家公司未经许可、绕过付费墙"系统性地抓取"其新闻内容,用于训练ChatGPT、Copilot及Bing AI等产品,并寻求销毁侵权AI系统。两家报纸称生成式AI是"吞噬自己的蛇"(a snake eating its own tail),正侵蚀新闻机构的商业模式。 关键数据:38页诉状(9月4日提交);这是继纽约时报等之后又一轮媒体联合诉讼,从单一报纸扩散到区域报业集团。 影响分析:版权诉讼持续蔓延意味着AI公司的训练数据合规成本与法律不确定性不断上升;若"合理使用"抗辩在司法层面落空,将对头部模型训练的数据策略构成系统性冲击。 📅9月4-5日
🇨🇳 国内动态
1. "五连板"龙版传媒遭上交所监管警示:AI漫剧播放1.2亿,营收仅80元 ⭐
事件简述:龙版传媒(605577)因AI视频业务信息披露前后不一,9月4日遭上交所对其及时任董秘孙福军予以监管警示。公司在8月26日半年报中高调宣称"首部AI漫剧《穿越1988》完成170集上线、全网播放量突破1.2亿、红果热度超4000万",推动股价8月31日至9月4日连续五个涨停、累计涨幅61.14%;但随后披露却前后矛盾——9月2、3日称"AI视频业务未产生营业收入",9月4日又改口称该业务6月营收约80元、7月营收约7.5万元,占经审计营收比例不足0.01%。 关键数据:AI漫剧播放量1.2亿 vs 实际营收6月约80元、7月约7.5万元(占比不足0.01%);股价五连板、累计涨61.14%。 影响分析:上交所的警示剑指"AI概念炒作+信披失真"这一A股顽疾,用真实营收数据戳破"AI转型"的叙事泡沫,向热衷蹭AI热点的上市公司释放强监管信号。 📅9月4日
📄 今日论文
1. The Natural Language Interaction Protocol and Standard for AI Agents
作者:Luyi Xing, Rasit Onur Topaloglu, Ranjan Sinha, et al. 核心贡献:提出并标准化一种面向AI智能体的自然语言交互协议(NLIP,已由Ecma International标准化),为异构Agent框架、模型、工具接口与执行环境之间建立统一的应用层通信协议,可基于现有传输层(HTTP/HTTPS、WebSocket、AMQP)运行,让不同组织、不同厂商的智能体可以互操作。 为什么重要:智能体生态正从"各厂商私有协议"走向"跨组织协作",一个开放标准协议是Agent规模化部署与互操作的基础设施,堪称智能体时代的"MCP/HTTP"。 📄 arXiv:2609.04135 📅9月3日
2. Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
作者:Yuntian Deng, Pengyu Nie, Stuart Shieber | 机构:Harvard 核心贡献:提出"训练式编译"(compile by training):把自然语言规范编译成可复用的本地神经函数——编译期由教师模型生成任务样本,训练一个挂在紧凑解释器上的小适配器,最终函数无需教师模型即可运行、存储、版本化并像普通软件一样组合。在FuzzyBench-Hard上达到83.6%语义准确率,远超现有Program-as-Weights编译器(该子集上无精确匹配)。 为什么重要:把一次性的大模型调用"固化"为可组合的本地函数,为降低重复推理成本与供应商依赖、构建"软件式"AI能力仓库提供了新路径。 📄 arXiv:2609.04199 📅9月3日
3. Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
作者:Boyan Li, Bingsen Chen, Chenghao Yang, et al. 核心贡献:针对推理模型后训练的两大主流方法——可验证奖励强化学习(RLVR)与在线策略蒸馏(OPD),证明简单的两阶段方案"先OPD后RL"(OPD-then-RL)在逻辑与数学推理基准上稳定优于纯OPD、纯RLVR及所有"单步融合"基线,并通过pass@k行为与参数更新给出系统解释:OPD先扩展学生的策略覆盖,RL再在扩展后的空间里做奖励优化。 为什么重要:后训练RL的策略选择直接影响推理模型上限,这条"先蒸馏铺路、再RL优化"的经验法则为DeepSeek、Qwen等开源推理模型的训练提供了低成本、可复现的流程范式。 📄 arXiv:2609.04108 📅9月3日
4. Epistemic Warrant for LLM Recommendations: Characterizing the Basis for Reliance When Ground Truth Is Unavailable
作者:Shai Vardi, João Sedoc 核心贡献:引入认识论中的"认识保证"(epistemic warrant)概念,刻画"没有真值可对"时用户凭什么信任一条LLM建议——通过四层依赖证书区分"不稳定/上下文依赖/局部支持/广泛支持"四种偏好稳定度,给出面向单条建议的、可操作的信任依据,而非笼统的模型可靠性评分。 为什么重要:在组织把LLM用于决策但缺乏人工核验的常态下,"该信哪一条建议"比"模型整体有多可靠"更实用,为LLM辅助决策的可信部署提供了新的评估维度。 📄 arXiv:2609.04127 📅9月3日