多模态指模型能够接收或生成多种类型的数据,而不仅限于文本。常见组合包括图像理解、语音识别、图像生成与视频生成。需要注意的是,「支持多模态」是一个笼统说法——具体支持哪些模态、是输入还是输出、有没有大小与格式限制,都要看对应模型的官方说明。

输入多模态和输出多模态不是一回事

  • 输入侧:能看懂图片、读取文档、听懂音频。这是目前最常见的一类,也是日常最实用的——截图排错、表格理解、图文材料整理都属于这一类。
  • 输出侧:能生成图片、音频或视频。这通常由专门的模型或专门的接口提供,不是通用对话模型的默认能力。

一个模型「支持多模态」不代表两侧都支持。

常见误解

  • 能上传 ≠ 能理解。 文件被接收和文件被正确解析是两回事。判断方法很简单:回答里如果能引用文件中的具体内容,说明它确实读到了;通篇泛泛而谈,多半没解析成功。
  • 图片也消耗额度。 图像输入会按一定规则折算成 token 计入上下文窗口,高分辨率图片消耗明显更多。
  • 兼容层容易静默降级。 第三方接口可能直接丢弃图片或音频输入而不报错,表现为「模型看不见我发的图」。

本站哪里会遇到

网页端的多模态用法见 Gemini 怎么用;接口侧各家支持的模态差异见三篇官方 API 教程,兼容层是否真的支持见 OpenAI 兼容接口怎么判断