🔦 今日速览

8月首个周末,AI行业迎来里程碑事件:OpenAI发布下一代模型Astra,以仅2000美元算力成本攻克十道数学未解难题,菲尔兹奖得主Gowers表示愿意推荐其证明至顶级期刊。欧盟《人工智能法》透明度规则于8月2日正式执法,全球AI监管进入实操阶段。中国开源大模型包揽OpenRouter全球调用量榜单前六,国产大模型全球下载量占比超41%,超越美国位居世界第一。

趋势1:AI从做任务到做原创研究的跨越 趋势2:全球AI监管从立法走向执法 趋势3:中国开源大模型生态超越美国


🌍 国际动态

1. OpenAI Astra攻克十道数学未解难题,菲尔兹奖得主背书:算力成本仅2000美元

事件简述:8月1日,OpenAI正式公布下一代模型家族Astra(拉丁语"群星"),并以一种前所未有的方式亮相——不是通过跑分榜单,而是发布了一份249页的论文,证明Astra成功解决了十道此前从未被攻克的数学难题。这些难题涵盖群论、编码理论、量子复杂性及格密码学等前沿领域,每道题学术积压时间均超过十年,全部求解的算力成本仅约2000美元。OpenAI将全部证明以Lean形式化语言发布在GitHub上,任何数学家可独立运行验证器确认证明无误。

关键数据10道未解数学难题;$2000算力成本;249页论文;Lean形式化证明可机器验证;涵盖群论中"非sofic群存在性"构造、单位距离猜想推翻、球堆积新上界等。

影响分析:菲尔兹奖得主Timothy Gowers表示,他愿意将其中一份证明推荐至《数学年刊》(Annals of Mathematics)——数学界最顶级期刊之一——"无需犹豫"。这是AI首次在数学这一最严谨的学科中做出可验证的原创贡献,而非仅仅在已有答案的测试中得分。2000美元的成本意味着,某些类型的数学研究正从"稀缺天才驱动"转向"算力可扩展活动",研究经济学的底层逻辑正在被改写。OpenAI选择以数学发现而非跑分来介绍Astra,被业界评价为"年度最聪明的模型发布策略"。 📅8月1日

2. 欧盟AI法透明度规则正式执法:聊天机器人必须亮明AI身份,违规罚全球年收3%

事件简述:8月2日,欧盟《人工智能法》第50条透明度规则正式进入执法阶段,标志着这部全球首部综合性AI监管法案从纸面规则全面转向实际操作。新规要求:所有面向欧盟用户的聊天机器人必须主动告知"你正在与AI对话";AI生成或修改的图像、视频、音频等深度伪造内容必须添加机器可读标记和明显标签;违规者最高可被处以全球年营业额3%1500万欧元的罚款。欧盟人工智能办公室同步公布了首批签署《AI生成内容透明度行为准则》的180多家机构名单。

关键数据:罚款最高全球年收3%1500万欧元180+机构签署行为准则;高风险系统规则延期至2027年12月(Digital Omnibus调整)。

影响分析:这是全球AI监管从"立法"到"执法"的关键转折点。虽然高风险系统规则因Digital Omnibus被推迟到2027年底,但透明度规则的即日生效已覆盖几乎所有面向消费者的AI产品——从客服聊天机器人到社交媒体AI生成内容。对于中国AI企业出海欧洲,合规压力立竿见影。 📅8月2日

3. 亚马逊完成对OpenAI 500亿美元全额投资,科技史上最大AI单笔投资落定

事件简述:亚马逊在7月31日提交的10-Q季报中披露,已完成对OpenAI总计500亿美元的全额投资。今年Q1亚马逊投入150亿美元购买OpenAI C轮优先股,Q2追加137亿美元,报告期后又将剩余213亿美元全部投入。若OpenAI完成IPO,C轮优先股将转换为普通股。这是迄今为止科技行业最大规模的AI公司单笔投资。

关键数据$500亿总投资;分三批完成(Q1 $150亿 + Q2 $137亿 + 后期 $213亿);C轮优先股结构。

影响分析:亚马逊500亿美元押注OpenAI,标志着云计算巨头对AI模型层的战略绑定进一步加深。对于AWS而言,锁定OpenAI意味着Bedrock平台上有了最前沿模型的独家/优先供应保障。对于OpenAI,这笔资金为其在Astra发布前提供了充足的算力资本,也为即将到来的IPO铺平了财务道路。 📅7月31日

4. Epoch AI预测:AI芯片部署量每9个月翻倍,算力爆发进入指数轨道

事件简述:据《纽约时报》8月1日报道,Epoch AI最新研究预测,未来几年AI芯片部署量将以每9个月翻倍的速度增长。这一增速远超摩尔定律(约每2年翻倍),意味着AI可用的总算力每两年半增长约10倍。该预测与当前科技巨头每年数千亿美元的AI基础设施资本支出形成呼应。

关键数据:每9个月翻倍;每2.5年增长10倍;微软Q2资本支出$450亿;Meta全年资本支出$1300-1450亿

影响分析:算力每9个月翻倍意味着Astra的2000美元数学突破只是开始——随着算力成本持续下降,这类"千美元级科研突破"将越来越频繁。算力瓶颈正从"是否有足够GPU"转向"电力、资本和散热"等物理基础设施约束。这也解释了为什么科技巨头在数据中心上的投入不降反增。 📅8月1日

5. 微软MDASH系统CyberGym基准测试达95.95%,断层领先所有前沿模型

事件简述:微软于8月2日公布其MDASH(Microsoft Detection and Automated Security Hardening)系统在CyberGym网络安全基准测试中取得95.95%的成绩,以超过10个百分点的优势断层领先第二名GPT-5.5 Cyber(85.6%)。MDASH的核心策略是模型组合:新发布的网络安全专用模型MAI-Cyber-1-Flash承担约90%的漏洞检测与修复工作,少数高难度任务交给GPT-5.4,总成本比此前方案低近50%。微软同时宣布Project Perception智能体安全平台将于8月3日进入公开预览,采用红队(攻击模拟)、蓝队(风险评估)、绿队(修复行动)三类AI智能体协同工作。

关键数据:CyberGym得分95.95%(断层第一);MAI-Cyber-1-Flash承担90%工作;成本降低~50%;Project Perception8月3日公开预览。

影响分析:微软的"小模型+大模型"组合策略证明,在专业领域,专用小模型配合大模型做兜底,比单一通用大模型更高效且更便宜。这对企业安全团队意味着,重复性漏洞排查和初步修复工作可大规模前移到AI系统中,安全分析师将更多聚焦于战略判断和复杂攻击应对。 📅8月2日


🇨🇳 国内动态

1. 国产开源大模型包揽全球调用量前六,下载量占比超41%跃居世界第一

事件简述:全球最大模型聚合平台OpenRouter公布的2026年7月月度调用量排行榜显示,前六名全部被中国自主研发的开源大模型包揽。上榜模型依次为:小米Mi-Mo-V2.5(支持百万token上下文,两个月调用量增长616%)、DeepSeek V4 Flash、腾讯HY3、MiniMax M3、智谱GLM-5.2以及DeepSeek V4Pro。央视财经数据显示,中国研发的开源模型下载量已占全球总量的41%,超越美国位居世界第一。

关键数据:OpenRouter调用量前6全部中国模型;全球下载量占比41%(超美国);小米Mi-Mo-V2.5两月增长616%;智谱GLM-5.2在Hugging Face遭袭事件中承担全部取证分析。

影响分析:这组数据标志着中国AI开源生态从"追赶者"到"领跑者"的质变。英国《卫报》8月1日刊文指出,中国开源大模型的崛起"引发了美国科技巨头之间乃至白宫内部的意见分歧"。硅谷老牌风投Vinod Khosla将杨植麟等人才的流失归咎于美国移民政策,称"美国正在亲手把杰出人才吓跑"。开源模型的普及正在动摇"闭源模型=更强"的行业假设。 📅8月2日

2. 山东12部门联合发文支持AI OPC:三年内集聚万名创新人才

事件简述:8月2日,山东省工信厅等12个部门联合印发《关于支持人工智能OPC创新发展的行动方案》,培育壮大AI OPC(One Person Company,一人公司)新型市场主体,推动"AI+超级个体"新型创业模式加速落地。方案提出三年内建成百个特色载体、培育千家技术领先创业主体、集聚万名优秀AI OPC创新人才。在空间布局上,支持济南、青岛、烟台等市依托数字经济产业园、双创孵化中心等打造一批AI OPC特色园区。

关键数据12部门联合发文;3年内百个载体、千家主体、万名人才;覆盖济南、青岛、烟台等市。

影响分析:这是全国首个省级层面专门针对AI OPC的系统性政策支持。在AI编码工具日益成熟的背景下,"一人公司"模式正从概念走向现实——一个人借助AI Agent完成从前需要整个团队的工作。山东的先行先试可能为其他省份提供政策模板,推动AI时代的创业形态变革。 📅8月2日

3. 国家超算互联网上线DeepSeek-V4-Flash正式版API:一键调用,无需配置

事件简述:8月2日,国家超算互联网宣布DeepSeek-V4-Flash正式版模型(DeepSeek-V4-Flash-0731)已上线,同步提供API调用服务及模型文件。用户无需进行繁琐的环境配置即可快速接入,面向企业和开发者提供高性能、安全可靠的普惠AI开发支撑。DeepSeek于7月31日开启V4-Flash公测,采用轻量化MoE架构,总参数284B,单次激活仅13B,支持百万级超长上下文,缓存命中输入仅0.2元/百万Token

关键数据:284B总参数/13B激活;0.2元/百万Token(缓存命中);百万级上下文;原生兼容OpenAI Responses API。

影响分析:国家超算互联网的接入意味着DeepSeek V4-Flash获得了国家级算力基础设施的背书和分发渠道。0.2元/百万Token的定价将国产大模型推理成本压至历史新低,直接与OpenAI Luna(降价后$0.2/百万Token)形成正面竞争。对于国内AI应用开发者,这是巨大的成本利好。 📅8月2日

4. 世界人工智能合作组织持续扩员:中方在联合国举行吹风会

事件简述:7月31日,外交部部长助理刘彬集体会见文莱、多哥、伊朗、苏丹、越南等国代表,并见证上述国家签署《关于成立世界人工智能合作组织的协定》。同日,格鲁吉亚、坦桑尼亚代表本国政府签署协定。此前7月16日,来自亚洲、非洲、拉美和欧洲的29个国家已成为创始成员国。同日,中国常驻联合国代表团在联合国总部举行WAIC 2026吹风会,联合国数字与新兴技术特使吉尔表示"世界人工智能大会具有里程碑式的重要意义"。

关键数据29个创始成员国;7月31日新增6国签署;联合国总部吹风会。

影响分析:中国正以"世界人工智能合作组织"为平台,构建不同于西方主导的AI治理框架。习近平主席在WAIC 2026上提出的"开源共享"叙事,正在通过多边外交渠道转化为实际的国际组织架构。这一组织与欧盟AI法案、美国AI行政令形成了三足鼎立的全球AI治理格局。 📅7月31日


📄 今日论文

1. AISPA:面向LLM应用的用户级系统提示词审计框架

作者:Xiangning Lin, Shenzhe Zhu, Shu Yang et al. | 机构:未注明 核心贡献:提出AISPA框架,用于审计AI应用中LLM的系统提示词(System Prompt)——开发者用来控制模型行为的隐藏指令。研究发现,商业AI产品的系统提示词几乎从不对外公开,导致用户和监管者无法了解AI在什么约束下运行。AISPA通过黑盒交互推断系统提示词的内容和约束,为AI透明度监管提供了技术工具。 为什么重要:欧盟AI法8月2日正式执法,要求聊天机器人必须告知用户"正在与AI对话",但系统提示词的透明度仍是一个盲区。AISPA为监管机构提供了审计AI系统内部行为约束的技术手段。 📄 arXiv:2607.28617 📅7月30日

2. "多采样优于自反思":Self-Refine和Reflexion在等Token成本下输给重复采样

作者:Iliya Mirzaei | 机构:未注明 核心贡献:对当前最流行的LLM自改进策略(Self-Refine、Reflexion、多轮辩论等)进行了严格的等Token成本对比实验。在1.5B到7B参数规模的模型上,简单的重复采样+选择最佳答案策略在绝大多数任务中优于所有复杂的自反思、自我批评和多轮辩论方法——当Token预算相同时,多采样比反思更有效。论文呼吁重新评估"让模型反思自己的错误"这一流行范式。 为什么重要:OpenAI的o1/o3和DeepSeek-R1等模型大量使用"推理时反思"策略,但本研究表明,在较小模型上,生成更多候选答案比让模型反思更划算。这对AI Agent的成本优化有直接指导意义——与其让Agent反复自我批评,不如多跑几次选最好的。 📄 arXiv:2607.28576 📅7月30日

3. ORCA-bench:大模型Agent能胜任On-Call运维吗?

作者:Albert Gong, Kyuseong Choi, Abhineet Agarwal et al. | 机构:未注明 核心贡献:提出ORCA-bench基准,评估LLM Agent在On-Call根因分析(RCA)场景中的表现。与代码编写或补丁修复不同,On-Call要求Agent从模糊的用户报障出发,在噪声指标、日志、分布式追踪和源码之间跨系统推理,且在故障发生数小时后才介入。评估发现,当前最强模型在真实On-Call场景中的表现远低于预期,暴露出Agent在跨系统关联推理和噪声容忍方面的严重不足。 为什么重要:微软MDASH和Project Perception展示了AI在安全运维中的潜力,但ORCA-bench证明,Agent在通用On-Call场景中还有很长的路要走。对于正在尝试"AI运维"的企业,这个基准提供了务实的现实检验。 📄 arXiv:2607.28545 📅7月30日

4. MANTA:多Agent网络拓扑自适应——让AI团队自我进化

作者:Mao-xun Huang, Jerry Wang, Yi-Cheng Lai et al. | 机构:未注明 核心贡献:提出MANTA框架,解决了多Agent系统中的关键瓶颈——通信拓扑通常是静态的,无法根据任务动态调整。MANTA让Agent系统在运行时自动发现最优通信结构:何时需要集中式调度、何时可以点对点直接通信、何时需要广播。在多个复杂推理任务上,动态拓扑比静态拓扑的效率提升显著。 为什么重要:OpenAI Astra是多智能体协同的产物,而MANTA提供了多Agent系统通信效率的理论基础。随着Agent数量和复杂度增长,如何让Agent"自我组织"而非依赖人工预定义通信规则,将成为多Agent系统扩展的关键。 📄 arXiv:2607.28527 📅7月30日