Gemini 3.1 Pro:长上下文和研究生级推理仍是谷歌的牌面
Google DeepMind 的 Gemini 3.1 Pro 在 2026 年 8 月的讨论里,很少被说成「综合第一」,却经常出现在「推理 / 长文档 / 多模态」三张短名单上。公开对比里,它在 GPQA Diamond 等研究生级科学推理测试上数字靠前,上下文窗口也明显大于多数对话产品的默认档。
和 ChatGPT、Claude 的差异更像生态:Gemini 嵌在 Search、Workspace、Android 和 Lens/Photos/YouTube 工作流里,MMMU 一类多模态榜常由它领跑。Flash 档(如 3.5 Flash)则覆盖要速度、要成本的场景。标准 SWE-bench 上它已追得很近,但最难的多文件工程任务仍常被认为略逊 Claude。
对已经把资料放在谷歌云盘和文档里的团队,换模型的切换成本,往往比再涨 2 分智力指数更关键。
