返回 AI 大白话
先认识 AI · 免费公开

多模态

Multimodal

先打个比方

像沟通时既能看说明又能看图片,但不一定还能画图或唱出来。

放到你的工作里

给支持看图的助手一张家电按钮照片,请它结合说明书解释按钮用途。

现在,回来看它的意思

能处理文字、图像、音频等多种信息形式,具体能接收什么、能生成什么,要分别查看。

但别这样理解

能看图不等于能生成图;图片细节、计数和文字识别也可能出错。

现在就试一小步

为一个任务列出输入和输出,例如输入照片与问题,输出待核对的文字说明。

找一个能做这件事的工具

想再了解一点

What are foundation models?

官方参考查阅于 2026-09-09 · 类比和例子为本站原创解释。