谷歌Gemini 3 Deep Think全面碾压Claude和GPT,清华校友参与打造,编程能力全球仅7人能超越它
北京时间2月13日,谷歌发布了Gemini 3 Deep Think推理模式的重大升级。这一专为复杂科学与工程任务打造的模型,在多项顶级基准测试中刷新纪录,全面超越Claude Opus 4.6和GPT-5.2。2025年9月加入谷歌DeepMind的清华大学物理系校友姚顺宇(Shunyu Yao)是此次升级的核心参与者之一,他当天在社交平台发帖号召用户体验新模型。

谷歌CEO桑达尔·皮查伊发帖表示:"我们与科学家和研究人员紧密合作,对Deep Think进行了改进,以应对棘手的现实挑战。"
从测试数据来看,Deep Think在"人类最后的考试"中取得48.4%的成绩(不使用工具),Claude Opus 4.6为40%,GPT-5.2为34.5%。在抽象推理测试ARC-AGI-2中,该模型达到84.6%,经ARC Prize基金会验证,此前最强模型得分在60%至70%之间。在竞技编程平台Codeforces上,Deep Think获得3455 Elo评分,相当于全球编程能力排名前八,仅7人能超越它。此外,该模型在2025年国际物理和化学奥林匹克竞赛笔试部分均达到金牌水平。
在科研实战中,罗格斯大学数学家Lisa Carbone利用Deep Think审阅一篇高能物理领域的专业数学论文,模型成功识别出一个此前人工同行评审未曾发现的细微逻辑缺陷。杜克大学实验室则借助该模型优化晶体生长制备方法,设计出可培育超过100微米薄膜的工艺方案,突破了以往方法的精度极限。Deep Think还具备将手绘草图转化为3D打印文件的工程能力,可自动完成图纸分析、复杂形状建模及文件生成。
在谷歌官宣评论区,一位AI从业者感慨:"如果这个模型在识别新模式(而不仅仅是记忆)方面真的达到了这样超人的水平,我们就应该停止称它为聊天机器人,而应该称它为外星智能。"一位谷歌前工程师评论道:"真正让人惊讶的是,Deep Think竟然发现了一篇经过同行评审的数学论文中,人类审稿人都忽略的逻辑缺陷。那不是工具,那是合作者。"
据谷歌官方博客,Deep Think现已在Gemini应用中上线,Google AI Ultra订阅用户可直接使用,同时首次通过Gemini API向部分研究人员、工程师和企业开放使用权限。
市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

- 苹果首款折叠屏iPhone Ultra即将亮相,产业链渗透率有望加速
- 汽车供应链赋能具身智能降本量产,核心零部件企业迎需求增量
- 东方证券、上海证券合并迎重要进展,股东会高票通过方案!券商重组浪潮延续
- 生猪价格8月以来涨超7.5% 机构关注养殖企业估值修复(附概念股)
- “金九银十”刚需背景下,焦煤行业价格弹性可期
- 国资委召开央企6G推进会,通信产业链迎来系统性催化
- 航空航天等需求释放叠加出口高增 国产金属3D打印设备迎量价齐升
- Moderna引爆mRNA癌症疫苗行情,低位龙头个股估值有望爆发
- 央行购金持续、金银基本面偏积极,美元购买力长期稀释,支撑金银价格涨势
- 全球衬底缺口显著、国产替代处爬坡阶段!核心原料企业受益
