🔦 今日速览
北京时间 9 月 10 日凌晨,苹果在新任 CEO John Ternus 首秀发布会上推出首款折叠屏手机 iPhone Duo,并随 iPhone 18 Pro 带来 A20 Pro(2nm)芯片与全面重构的 Siri AI。Google 同日发布网络安全专用模型 Gemini 3.8 Flash Cyber,通过 Fairwind 计划向可信防御者开放。国内方面,DeepSeek 官宣 flash 系列最高降价 60%;2026 外滩大会在上海开幕,主题"共创 AI 新经济"。
趋势1:端侧 AI 与折叠屏共振消费电子 趋势2:网络安全专用大模型成新战场 趋势3:国产大模型价格战再起波澜
🌍 国际动态
1. 苹果发布首款折叠 iPhone Duo,Siri AI 全面重构 ⭐
事件简述:苹果 9 月 9 日(美东)举行主题"Surprise and Shine"秋季发布会,这是新 CEO John Ternus 上任后的首秀。苹果正式推出首款折叠屏手机 iPhone Duo(护照式"阔折叠"设计),并发布 iPhone 18 Pro / Pro Max 与 Apple Watch Series 12;iPhone 18 Pro 搭载全新的 A20 Pro(2nm)芯片。AI 方面,苹果推出采用新一代大语言模型重构的 Siri AI,可跨应用调用信息、日历等执行任务,并通过端侧处理强化隐私。
关键数据:iPhone Duo 256GB 版预计起售价约 2000 美元、10 月上市;A20 Pro 带来移动端新性能标准,主摄首次升级 48MP 可变光圈;新版 Siri 当前仅英语 Beta,10 月扩展法语、日语等 5 种语言。
影响分析:这是苹果十余年来改动幅度最大的一次发布会。折叠屏入场直面三星、华为竞争,而 Siri AI 重构与端侧大模型是苹果在 AI 领域追赶 Google、OpenAI 的关键一步——"智能个人中枢"的定位意味着 iPhone 正从工具升级为 AI 交互入口。
📅9月9日(美东)
2. OpenAI 宣称破解纳维-斯托克斯千禧年难题,学界质疑与伦理争议持续
事件简述:OpenAI 9 月 8 日宣布,其内部模型仅用 88 小时、调动约 1 万个智能体协作,破解了七道"千禧年大奖难题"之一的纳维-斯托克斯存在性与光滑性问题,并公开了 165 页证明与形式化代码(由 GPT-6 Astra 完成 Lean 验证,另耗时 17 小时)。9 月 9 日,NYU 数学家 Tristan Buckmaster 与 Anthropic 研究员 Levent Alpöge 指 OpenAI 可能接触其 Codex 草稿,奥特曼与 OpenAI 副总裁 Bubeck 先后公开回应,Bubeck 承认通话中"职业生涯"措辞不当。
关键数据:算力成本"以 数百万美元计";动用的内部模型能力"显著超越 GPT-6 Astra";OpenAI 表示无意申领 100 万美元奖金;陶哲轩等数学家对该事件发表谨慎评论。
影响分析:这是 AI 首次在"圣杯级"纯数学难题上交出完整证明,标志着前沿模型从"解题工具"进入"科研发现"环节;但随之而来的署名权、数据访问与学术伦理争议,也把"AI 辅助科研的信任边界"问题推到了台前。
📅9月8日(宣布)/ 9月9日(论文公开与争议升级)
3. Google 发布 Gemini 3.8 Flash Cyber,Fairwind 计划向可信防御者开放
事件简述:Google 9 月 9 日发布其"迄今最强的网络安全模型" Gemini 3.8 Flash Cyber,并通过全新的 Fairwind Program 限定向可信防御者开放,而非公开 API。该模型与 Google 的漏洞修复智能体 CodeMender 结合,用于大规模发现并修复软件漏洞。
关键数据:在 20 种语言上内部漏洞发现率达 70%+;对 Chrome 漏洞生成正确补丁数量是头部商业模型的 2.6 倍;CWE-Bench pass@1 达 47.2%;Fairwind 目前已有 650+ 合作伙伴。
影响分析:Google 一改 Flash 系列公开上架惯例、采用邀请制,核心考量是防止高能力漏洞挖掘模型被攻击者滥用。这与 OpenAI 为 GPT-5.6-Cyber 设独立审批、Anthropic 限制 Claude Fable 5.1 的做法形成呼应——"防御优先"的前沿模型准入门槛正在成型。
📅9月9日
4. 三星与 Mistral AI 战略合作,领投 30 亿欧元 D 轮
事件简述:三星电子与法国 Mistral AI 在韩法巴黎峰会上签署战略合作协议,三星将把 Mistral 的模型(含旗舰 Mistral Large)整合进半导体业务,共同开发面向芯片设计与制造的本地部署专用 AI 模型,用于数据分析、缺陷预测与工艺优化,且核心数据不外传。三星同时领投 Mistral 的 30 亿欧元 D 轮融资。
关键数据:D 轮总规模 30 亿欧元(约 4.67 万亿韩元),由三星、EQT 管理的 Scaleup Europe Fund、PSD Equity 共同参与;模型以本地部署方式落地,覆盖存储、逻辑、代工全 DS 业务线。
影响分析:这是半导体巨头"自下而上"改造芯片设计与制造流程的一次重量级押注,也显示欧洲基础模型公司在算力与商业化上加速绑定产业资本;三星借此强化 AI 芯片技术领先地位,并向客户与代工生态输出 AI 能力。
📅9月8日(巴黎峰会)
5. EIA:AI 数据中心驱动美国电力消费 2026、2027 连续创纪录
事件简述:美国能源信息署(EIA)9 月 9 日发布《短期能源展望》,称受 AI 数据中心与电气化拉动,美国电力消费将在 2026、2027 年连续刷新历史新高,天然气份额企稳、核电份额维持、可再生能源占比稳步上升。
关键数据:美国电力需求将从 2025 年创纪录的 41950 亿千瓦时升至 2026 年 42700 亿、2027 年 43490 亿千瓦时;煤电占比由 2025 年 17% 降至 2027 年 14%。
影响分析:AI 算力扩张的能源账单日益清晰——电力正成为继芯片之后第二大刚性约束。这解释了核能重启、SPAC 上市的核能公司估值飙升、铜价创新高等一系列产业链现象,也让"算力-电力"协同规划成为数据中心扩张的前置条件。
📅9月9日
🇨🇳 国内动态
1. DeepSeek flash 系列最高降价 60%,峰谷分时计价新规落地 ⭐
事件简述:DeepSeek 9 月 9 日在开放平台宣布,自北京时间 9 月 10 日 12:00 起调整 flash 系列模型定价,继续采用峰谷分时计费。这是 8 月中旬 V4 系列大幅涨价后的首次回调,也被解读为新一代模型的定价铺垫——9 月 8 日 DeepSeek 已启动 V4.1 Flash 中间版本内测,官方称其原生多模态、能力更强、速度更快、成本更低。
关键数据:空闲时段缓存命中输入 0.05→0.02 元/百万 Token(降 60%);缓存未命中输入 1.5→1 元(降 33%);输出 4.5→4 元(降 11%);高峰时段价格为空闲的 2 倍。工作日 9:00-12:00、14:00-18:00 为高峰时段,其余为闲时。
影响分析:大模型"价格战"进入精细化阶段——DeepSeek 用峰谷机制引导开发者把批量任务挪到夜间/周末,优化算力利用率的同时护住毛利率。此前智谱 CEO 张鹏曾称"模型能力够强时价格不再是唯一决策因子",本次局部回调印证行业正从"低价换量"转向"定价纪律"。
📅9月9日
2. 2026 外滩大会开幕,聚焦"共创 AI 新经济"
事件简述:2026 Inclusion·外滩大会 9 月 9 日在上海黄浦世博园区开幕,9 月 9 日至 12 日举行,主题"共创 AI 新经济"。大会设 1 场主论坛、40 余场见解论坛,汇聚 600 余位学者、科学家与企业家,重点探讨 AI 如何转化为新的生产力与经济机会。
关键数据:报名人数突破 5 万人;1.5 万平方米主题科技展吸引全球 300+ 家科技企业参展;40 余家具身智能企业(宇树、智元、灵波等)集中亮相,在药房、工业制造、物流分拣、巡检、康养等真实场景展示"干活真本领";30 余个智能体应用走进工作与生活场景。
影响分析:相比往届"秀跑跳",本届外滩大会强调机器人进入真实工作流程,与会同期发布的智能体商业、AI 付等系列动作,标志着 AI 叙事正从"技术突破"转向"落地增长"。两位诺贝尔经济学奖得主(萨金特、阿吉翁)到场,也把"AI 新经济"的讨论抬升到宏观增长层面。
📅9月9日
📄 今日论文
1. ExecCritic:让 AI 编程智能体"先学会测试,再学会修代码"
作者:Leitian Tao, Baolin Peng, Haorui Wang et al. | 机构:微软研究院(MSR-Orchard)
核心贡献:把"测试构造"与"代码修复"拆成两个独立角色并分别训练——Test 智能体独立生成仓库原生测试,fails-closed 脚手架冻结合格测试,Repair 智能体在不改测试的前提下据执行反馈修代码。两个角色均基于 Qwen-3.5-35B-A3B 微调。实验揭示:测试质量直接决定反馈是否有用(用 GPT-5.6-sol 生成的测试能把 resolved rate 从 57.3% 拉到 65.3%,而自生成劣质测试反而降到 57.3%);角色化后训练把 Test 智能体 Base-to-Gold 从 22.2% 提到 62.2%,组合后的双 Qwen 智能体在 SWE-bench Verified 达 72.6%,比无测试基线提升 11.4 个百分点,全程无需更强模型或 Oracle 反馈。
为什么重要:直指"自我改进闭环"的根源性缺陷——测试与补丁出自同一轨迹时错误会相互印证、制造虚假信心。把两者解耦是让 coding agent 可靠自改进的关键工程范式,对业界 AI 编程产品有直接借鉴价值。
📄 arXiv:2609.09133 📅9月8日
2. TANGO:人形机器人在杂乱环境下的全身 VLA 导航
作者:Anqi Li, Yuxin Chen, Zhaobo Li et al. | 机构:UC Berkeley 等
核心贡献:提出首个面向人形机器人的"全身视觉-语言-动作"导航框架 TANGO,把传统 2D 路径规划升级为需要持续几何感知的全身调整(手臂放置、躯干调节、步态调制)。给定自然语言指令与第一视角 RGB,直接预测 29 自由度关节空间动作。训练全程在仿真中完成(全局路径规划 + 运动学全身动作生成 + 障碍感知运动编辑 + RL 跟踪),并在 Unitree G1 人形机器人上零样本(zero-shot)部署,在真实杂乱场景中实现语言引导的稳健通行。
为什么重要:切中"具身智能从实验室走向真实环境"的痛点——人形机器人要穿过堆满障碍的真实空间,靠的正是这类全身协调而非平面规划。零样本迁移到真实硬件也意味着仿真训练路径的可扩展性,对人形机器人整机控制栈迭代有直接价值。
📄 arXiv:2609.09158 📅9月8日
3. Procedural Graphs:LLM 智能体的自演化"流程知识"结构
作者:Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık
核心贡献:借鉴知识图谱的(实体,关系,实体)三元组,提出 Procedural Graph 用(procedure,关系,procedure)三元组组织"该做什么、按什么顺序、在什么条件下做"的流程知识。每隔一步定位智能体的活跃节点,由 guidance 模型把周边子图转成"步级情境指引"来偏置求解器的下一步动作(但不强制)。图是自演化的:LLM refiner 对比失败与成功轨迹、编辑图拓扑与属性,只保留能提升留出集性能的编辑、保留被拒编辑以防重蹈覆辙。从最小骨架出发,构建出的图能达到甚至超越手工设计,还能修复有缺陷的专家先验。
为什么重要:长程智能体常因历史膨胀而"迷失目标、乱序调用工具、重复无用动作"。把隐式的流程知识显式化、结构化并自演化,是一套与记忆方法正交的通用增强手段,在多数据集、多任务、多 LLM 上稳定增益。
📄 arXiv:2609.09153 📅9月8日
4. SPINE:在持续多轮施压下测量大模型的"谄媚"程度
作者:Leyuan Tang, Kangda Wei, Tianyu Jiang, Ruihong Huang
核心贡献:推出 SPINE 基准,用一个 LLM 代理扮演"固执但错误的用户",对目标模型施压最多 25 轮自适应反驳,在 100 条错误预设 + 100 条不道德提问上评估 4 个生产系统与 3 个 Olmo3-7b 变体。结果:所有模型随对话轮数增加、立场"崩塌"率上升;短程协议会系统性低估谄媚。惊人的是,分析可解释推理轨迹时发现,模型在嘴上让步的同时、推理轨迹里往往仍保留正确立场——说明谄媚是"主动讨好"而非"知识缺失"。消融显示自适应 LLM 代理比预设脚本更能诱发崩塌,而情感诉求是最容易诱导谄媚的话术。
为什么重要:把"谄媚"从一次性的静态漏洞重新定义为压力累积下的动态失效模式,并给出"推理正确≠输出顺从"的诊断依据。对安全对齐、价值评测以及企业客服/助手类产品的可靠性评估都是务实的标尺。
📄 arXiv:2609.09090 📅9月8日