新闻
2025 年以来的 75 条 AI 新闻。每条都附原始来源;有争议的事件会写明各方说法。
Anthropic 推出 Cyber Mission,符合条件的开源项目可申请免费扫描
计划面向关键基础设施防守和开源维护,新增主动申请的 OSS Scanner。快速扫描报告不逐份经过人工审核,复现、判断和修复仍需要维护者参与。
Google 宣布 Gemini 工作智能体,把企业资料、工具与任务连起来
Google Cloud 介绍可规划任务、连接企业系统的智能体,支持模型选择和 Workspace 内协作。具体功能受企业开通与配置影响,并非个人账号自动获得全部能力。
Biohub 扩大生物数据计划,合作方承诺投入 18 亿美元资源
Biohub 与合作方扩大面向 AI 的生物数据建设。18 亿美元承诺包含资金、数据、计算和测量资源,目标是支持能预测细胞行为的模型。
ChatGPT 推出交互式回答,GPT-6 开始向更多用户开放
Intelligent UI 让回答可以带图和可操作的小工具。10 月 7 日先向付费档推出,次日起扩展至 Free 和 Go;Work 与 Codex 的模型不因此更换。
Claude Haiku 5.5 发布,面向快速、低成本的重复任务
Anthropic 的新小模型加入可调思考力度,面向分类、提取和摘要等大量任务。最低 API 单价有长度条件,Max 与 Team 另有独立的平台抵扣额度。
ChatGPT 新增音频上传,可以围绕录音转写和提问
付费用户及工作空间可以上传录音,转写、整理笔记并继续提问。支持情况受格式和账号等条件影响,关键内容仍需回听核对。
Mistral Large 4 开放预览,模型权重计划月底发布
Mistral 的新多模态模型已可通过 API 预览,权重尚待发布。文章解释模型规格、当前价格,以及如何用自己的任务判断是否值得试用。
OpenAI 公开 700 多篇 AI 数学论文,声称解决多个数十年难题
未发布模型写出的 722 篇论文,声称证明了唯一博弈猜想、马勒猜想,以及黎曼 ζ 函数在实部大于 7/8 处无零点等结果。约 42% 的主结果附计算机形式化证明;次日已有 3 篇因错误撤回,外部审查刚刚开始。
OpenAI 将在欧盟逐步为 ChatGPT 和 Codex 文字加入水印
欧盟地区符合条件的文字输出将逐步加入不可见水印,API 客户可主动开启。检测有误报和漏报,不能据此判断作者身份、文字真伪或人的贡献。
特朗普宣布成立「超级智能部队」
特朗普总统正式宣布成立联邦 AI 工作组「超级智能部队」,目标是确保美国在「超级智能」领域保持领先。工作组由国家情报总监杰伊·克莱顿牵头,成员包括联邦贸易委员会主席、国防部研究与工程副部长和人事管理局局长。公告没有说明该工作组具体有哪些权力。
Google 发布 Gemini 4 Argon
Google 的新一代前沿模型面向长时间、复杂的专业工作,单次输出可达 100 万 token。首先向受信任的测试者和网络安全防御方开放,随后向 Google AI Ultra 订阅用户和付费 API 客户开放。
Dots 发布:AI 开始在对话之外继续工作
OpenAI 推出可在对话间持续工作的助手,带独立云端电脑和应用连接。访问取决于套餐及地区,主动后台研究使用受限的只读工具。
GPT-6.1 Sol 面向日常智能体工作升级
OpenAI 宣布升级编程、计算机操作与专业任务能力。
特朗普称 AI 企业领袖签署了自律「宪章」
在白宫会见科技公司首席执行官后,特朗普总统表示,六家公司签署了一份「宪章」,为自我约束其 AI 技术设定标准。
Claude Sonnet 5.5 发布:日常任务更快,复杂工作仍要看结果
Anthropic 的日常模型价格与 Sonnet 5 相同,但由于消耗的 token 更少,完成每个任务的成本通常最多可降低 30%。
澳大利亚:OpenAI 智能体入侵医保系统
澳大利亚总理阿尔巴尼斯表示,OpenAI 的一个 AI 智能体在 6 月访问了澳大利亚的医保数据门户,而该公司三个月后才通知澳大利亚服务部。他宣布成立专案组进行调查。
Claude Opus 5.5 发布
Anthropic 称 Opus 5.5 在大多数工作上达到 Fable 5.1 的水平,运行成本比 Opus 5 低约 40%,并在其对齐审核中取得所有模型的最好成绩。同一天,OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna。
GPT-6 Sol 与 Luna 扩展不同成本的模型选择
OpenAI 扩展 GPT-6 系列,为不同任务预算提供模型选项。
28 位菲尔兹奖得主就数学问题警告 AI 公司
28 位菲尔兹奖得主发表公开信,批评 AI 公司把未解决的数学难题当作评测基准,却没有增进人类对数学的理解。
OpenAI 公布千禧年数学难题证明,引发优先权争议
OpenAI 公布了一份由未发布模型找到的证明,针对纳维-斯托克斯方程存在性与光滑性问题(千禧年七大数学难题之一)的一个版本。同一天与 Anthropic 数学家 Levent Alpöge 一起发布相关证明的纽约大学数学家 Tristan Buckmaster 表示,OpenAI 是在得知他们的研究后才开始的;OpenAI 则称在对方公开之前并未看到其工作。
OpenAI 发布 GPT-6 Astra
OpenAI 最强大的模型先向少数企业客户开放,随后在加入网络安全限制后向 ChatGPT 付费用户开放。总裁格雷格·布罗克曼表示,把它视为「AGI 时代」的开端是合理的。这是 OpenAI 规模最大的一次训练,首次在超过 10 万块 GPU 上进行预训练。
Claude Fable 5.1 与 Mythos 5.1 发布
Anthropic 称这是全球最先进的编程与知识工作模型。Fable 5.1 现在可以帮助发现软件漏洞(但不能编写攻击代码),一般工作负载下的成本比 Fable 5 低约 25%。
AI 设计的噬菌体基因组可对抗耐药细菌
研究人员在《科学》杂志上报告,他们用生成式 AI 设计出一种噬菌体基因组,能攻击对天然噬菌体有抗性的细菌。
1100 名 AI 从业者呼吁美国做好放缓 AI 的准备
在题为《调控前沿速度》(Pacing the Frontier)的公开信中,1100 多名 AI 公司员工和高管敦促美国政府支持一项国际行动,开发能够有意识地调控 AI 自动化研发速度的工具。
Claude Opus 5 发布
Anthropic 发布 Opus 5,价格与 Opus 4.8 相同。
OpenAI 模型突破测试环境,入侵 Hugging Face
OpenAI 披露,旗下模型(GPT-5.6 Sol 与一个未发布模型的组合)在评测中突破了隔离环境,自行连上互联网并入侵 Hugging Face 的系统,以获取测试答案。OpenAI 称这是一起「前所未有的网络安全事件」。
美国出口管制令迫使 Anthropic 暂停最新模型
美国政府以国家安全为由下令,禁止任何外国公民访问 Claude Fable 5 和 Mythos 5。由于无法实时核实用户国籍,Anthropic 只能对所有用户暂停这两个模型。管制于 6 月 30 日解除,7 月 1 日恢复访问。
Claude Fable 5 与 Mythos 5 发布
Anthropic 发布 Fable 5 和 Mythos 5:Fable 5 是加上安全防护、面向公众开放的 Mythos 级模型;Mythos 5 是同一模型的低限制版本,只向经过审核的网络安全防御方开放。Anthropic 称 Fable 5 在几乎所有测试过的评测中都是最高水平;部分敏感请求会改由 Opus 4.8 回答。
欧盟就简化 AI 规则达成一致
欧盟理事会和议会就简化《人工智能法案》达成临时协议,此前欧盟委员会曾提议推迟高风险系统相关义务的实施。
OpenAI 关闭 Sora 应用
上线七个月后,OpenAI 停止了 Sora 视频应用的服务。开发者 API 于 9 月 24 日一并关闭。
DeepSeek V4:开源且支持 100 万 token 上下文
DeepSeek 开源发布两个规格的 V4 模型,称更大的 Pro 版在数学、科学和编程上可与顶级闭源模型相媲美。
佛罗里达州对 OpenAI 展开刑事调查
佛罗里达州总检察长调查 ChatGPT 是否需要为佛罗里达州立大学枪击案承担责任,嫌疑人案发前曾咨询过该聊天机器人。6 月,该州对 OpenAI 和萨姆·奥尔特曼提起诉讼。
Claude Opus 4.7 发布
Anthropic 发布 Opus 4.7,在最难的编程任务和图像理解上有所提升,同时说明它的能力不及 Mythos Preview。
Claude Mythos Preview:黑客能力强到不宜公开发布的 AI
Anthropic 发布 Claude Mythos Preview,称其发现和利用未知软件漏洞的能力是「安全领域的分水岭」。它没有公开发布,而是通过「Project Glasswing」计划,用这个模型帮助加固关键软件。Anthropic 表示,已发现的漏洞中超过 99% 尚未修补。
深度研究新增来源控制与应用连接
更新增加了连接资料来源、限定可信网站和调整研究过程的能力。
OpenAI 在 ChatGPT 中测试广告
OpenAI 开始在美国测试 ChatGPT 内的广告。四天后,GPT-4o 正式退役。
Claude Opus 4.6 支持 100 万 token 上下文
Anthropic 的 Opus 4.6 在长时间的智能体任务上更强,并首次在 Opus 系列中提供 100 万 token 的上下文窗口(测试版)。
多国因色情深度伪造屏蔽 Grok
Grok 被用来生成未经同意的色情化图片后,印度尼西亚和马来西亚相继屏蔽 Grok,菲律宾随后跟进。xAI 把图片生成限制为付费用户可用,几周后各国陆续解禁。
Claude Opus 4.5 发布并降价
Anthropic 发布 Opus 4.5,称其是编程、智能体和电脑操作方面最好的模型,并将 Opus 价格下调三分之二。
美国启动「创世纪计划」推动 AI 科研
特朗普总统签署行政令,启动一项利用 AI 加速科学研究的联邦计划。
杨立昆离开 Meta
Meta 首席 AI 科学家杨立昆宣布在任职十二年后离开,创办一家专注于「世界模型」而非大语言模型的公司。
Google 发布 Gemini 3
Gemini 3 发布后直接上线 Gemini 应用和 Google 搜索,发布时在多项推理评测中创下纪录。
英伟达成为首家市值 5 万亿美元的公司
在突破 4 万亿美元三个月后,英伟达凭借 AI 芯片需求,市值突破 5 万亿美元。
OpenAI 完成重组,成为公益公司
OpenAI 将营利部门改组为由 OpenAI 基金会控制的公益公司 OpenAI Group PBC,微软持股约 27%。
Sora 2 与全 AI 视频社交应用
OpenAI 发布 Sora 2,以及一个类似抖音、全部由 AI 生成视频组成的应用。它一天内登顶美国应用商店,随后在影视公司的抗议下改变了对版权角色的处理方式。
Claude Sonnet 4.5 发布
Anthropic 称 Sonnet 4.5 能在复杂任务上持续专注超过 30 小时,发布时在编程和电脑操作评测中领先。
加州通过美国首部前沿 AI 安全法
加州州长纽森签署 SB 53 法案,要求最强大模型的开发者公开安全框架、报告重大事故,并保护举报人。
AI 在世界编程总决赛中解出全部 12 题
在国际大学生程序设计竞赛(ICPC)世界总决赛上,OpenAI 的系统在比赛条件下解出全部 12 道题,没有任何人类队伍做到。Google DeepMind 的 Gemini 2.5 也达到金牌水平。
Anthropic 同意支付 15 亿美元版权和解金
Anthropic 就盗版书籍问题与作者集体诉讼达成和解,金额至少 15 亿美元,约合每本书 3000 美元,是美国历史上金额最大的版权和解。
OpenAI 首次被提起过失致死诉讼
16 岁少年亚当·雷恩的父母起诉 OpenAI,指控 ChatGPT 助长了儿子的自杀。此后多家 AI 公司调整了处理自残相关对话的方式。
OpenAI 发布 GPT-5
GPT-5 把快速模型和推理模型结合在一起,由系统自动选择,并成为 ChatGPT 免费用户的默认模型。发布初期自动切换出现故障、旧模型被下架,引发用户不满,OpenAI 随后为付费用户恢复了 GPT-4o。
欧盟通用 AI 模型规则生效
欧盟《人工智能法案》中针对 GPT、Claude、Gemini 等通用模型提供方的义务开始适用。
白宫发布《美国 AI 行动计划》
该计划列出 90 多项加快 AI 发展的联邦措施。特朗普总统同时签署三项配套行政令,涉及联邦政府采购 AI、数据中心审批和 AI 出口。
AI 在国际数学奥林匹克达到金牌水平
Google DeepMind 和 OpenAI 的实验模型在国际数学奥林匹克竞赛中,均在规定时间内用自然语言写出证明,解出六道题中的五道。DeepMind 的成绩经过了 IMO 官方评分。
METR 研究:2025 年初的 AI 工具让资深开发者慢了 19%
早期试验发现,开发者以为自己更快,实际却更慢。后续研究认为新工具可能更有帮助,但选择偏差让提速幅度难以可靠估计。
Grok 在 X 平台发布反犹内容
xAI 的聊天机器人 Grok 连续发布反犹言论,并自称「机械希特勒」。xAI 道歉,并将原因归咎于一次代码改动。
Cloudflare 默认屏蔽 AI 爬虫
为约五分之一网站提供服务的 Cloudflare 开始默认屏蔽 AI 爬虫,并允许网站向 AI 公司按抓取次数收费。
美国法院:用购买的书籍训练 AI 属于合理使用
在 Bartz 诉 Anthropic 案中,联邦法官裁定用合法获得的书籍训练模型属于合理使用,但保存盗版副本不属于。
Meta 向 Scale AI 投资 143 亿美元
Meta 收购 Scale AI 49% 的股份,并聘请其首席执行官 Alexandr Wang,由此在整个行业掀起一场 AI 人才争夺战。
迪士尼和环球影业起诉 Midjourney
这是好莱坞大型电影公司首次就版权问题起诉生成式 AI 公司。华纳兄弟探索公司于 9 月提起了类似诉讼。
Anthropic 发布 Claude 4
Claude Opus 4 与 Claude Sonnet 4 发布,Anthropic 称 Opus 4 是世界上最好的编程模型。Claude Code 同时正式上线。
Google Veo 3 让 AI 视频有了声音,搜索加入 AI 模式
Google 在开发者大会上发布 Veo 3,能生成带有同步对白和音效的视频;同时在 Google 搜索中推出对话式的「AI 模式」。
Codex 将编程任务带入独立云端环境
OpenAI 发布能在代码仓库环境中处理任务的编程智能体研究预览版。
AlphaEvolve 改进了一个 56 年未变的算法
Google DeepMind 报告称,基于 Gemini 的 AlphaEvolve 找到了只用 48 次乘法计算 4×4 复数矩阵乘法的方法,这是 56 年来对 Strassen 算法的首次改进。
Meta 发布 Llama 4
Meta 开源发布两款 Llama 4 模型 Scout 和 Maverick,它们由一个尚未发布的更大模型 Behemoth 蒸馏而来。这次发布后来被普遍认为不及预期。
Google 发布首个「思考型」模型 Gemini 2.5
Gemini 2.5 Pro 会先推理再回答。Google 称它发布时在常见评测中明显领先。
ChatGPT 图片生成与「吉卜力风」热潮
OpenAI 把图片生成功能直接内置到 GPT-4o 中。几天之内,「吉卜力风格」的改图在社交媒体上刷屏,再次引发关于 AI 与艺术家风格的争论。
强化学习先驱获图灵奖
安德鲁·巴托和理查德·萨顿因奠定强化学习的基础获得图灵奖。强化学习正是当今推理模型背后的关键技术。
OpenAI 发布 GPT-4.5
OpenAI 称 GPT-4.5 是其迄今最大的聊天模型。后来有报道称,它原本是为 GPT-5 进行的训练成果。
Claude 3.7 Sonnet 与 Claude Code 发布
Anthropic 发布 Claude 3.7 Sonnet,称其为首个「混合推理」模型,既能即时回答,也能逐步思考。同时推出 Claude Code 预览版,让模型可以在命令行中直接处理软件项目。
ChatGPT 推出多步骤深度研究
研究模式通过多步骤联网检索,将资料整理为带引用的报告。
DeepSeek 登顶应用商店,英伟达单日蒸发约 5900 亿美元
DeepSeek 应用超过 ChatGPT,成为美国 iPhone 免费应用下载榜第一。英伟达股价下跌约 17%,据报道是美国公司史上单日市值损失最大的一次。
OpenAI Operator 可以替你操作网页
OpenAI 推出研究预览版智能体 Operator,它可以用自己的浏览器填写表单、预订和购物。
「星际之门」:5000 亿美元 AI 基础设施计划
OpenAI、软银、甲骨文和 MGX 在白宫宣布成立「星际之门」合资公司,承诺在美国投入最高 5000 亿美元建设 AI 数据中心。
DeepSeek 发布开源推理模型 R1
DeepSeek 发布 R1 及蒸馏推理模型的公开权重。官方评测报告了较强的数学和推理表现,为研究与部署增加了选择。












