rshop-hk.com

多模态三条路:Gemini 看图看视频,ChatGPT 抢语音,Claude 吃长文档

AI新闻 · 大模型

2026 年 8 月,多模态已经不是「能不能看图」的是非题,而是各家押不同入口。Gemini 在独立多模态榜和 Lens/相册/YouTube 工作流上最完整,并往图像与视频生成(Veo 等)延伸。ChatGPT 则把实时语音和对话内生图做成更完整的消费体验。Claude 很少被拿来和「生成一张海报」比,它的长处是读合同、读论文、读代码库。

这对内容站的选题结构很友好:同一周可以发三条不重复的稿——视觉工作流、语音助手、文档智能。读者关心的是自己的文件在哪,而不是参数量。

需要避免的写法是把「多模态第一」当成总冠军。第一通常只在某一类基准或某一类 App 里成立。