图文混合理解任务配多模态模型,感知、对齐、推理三层该怎么分工?
图文混合理解任务的模型配置不是挑一个最强模型,而是先按感知、对齐、推理三层拆开:版面与 OCR 交给专用视觉模型,图文映射交给轻量对齐模型,跨模态问答与决策才交给大模型。只有单图简单描述、或图像信息能稳定转成结构文本的任务,才不必拆层,可直接单模型调用。
图文混合理解任务配模型的第一原则是分层而不是选最强:把任务拆成看懂画面、读出文字、跨模态推理三类,分别配专用模型,只有当输入是单张简单图片且只需一句概括时,才适合用一个通用多模态模型直接完成。分层的目的不是增加组件,而是让每一段职责的失败模式可定位、可替换。
先做任务分解,判断这条链路吃的是像素还是文字。文档、票据、报表、合同截图的价值几乎全在文字和版面上,模型的主要职责是定位与识别;商品图、现场照片、巡检图像的判断依据在纹理、颜色和空间关系上,模型要做的是视觉特征抽取。两类需求混在同一个模型里跑,通常会让准确率和成本同时变差。
文档类图文应以版面分析和 OCR 为主干,大模型只做后置的结构化归并与字段校验。原因是文字识别本身是确定性任务,专用模型的字符级表现更可预期;而让大模型直接看图读数,在密集表格和低分辨率截图上容易给出看似合理却错误的数值,且这类错误很难靠提示词消除,只能靠上游识别质量兜住。
自然图像理解适合两段式配置:视觉编码器负责把图像压成视觉特征,语言模型负责基于特征做描述、分类或问答。这里的核心参数不是模型参数量,而是视觉特征的压缩比——压缩得越狠,单张图的成本越低,但小目标、细粒度文字和颜色差异会最先丢失,因此压缩比要按业务能容忍的误判类型来定。
多图、多页输入时,配置重点从单模型能力转向上下文预算管理。几十页的图文材料如果整页转成视觉特征,上下文会被迅速占满,推理质量反而下降。可行做法是两级投递:先让轻量模型对每页产出摘要与关键字段,再把摘要连同少量原图送入大模型做全局推理,既保住细节入口,也保住全局判断。
路由层是成本结构的分水岭,应当在架构里显式存在,而不是靠人工切换模型。把请求按复杂度分档:分类、打标、简单描述走轻量档;涉及多图对比、隐含因果、需要结合业务规则判断的走重量档。分档依据要写成可解释的特征,例如图像数量、是否含表格、是否要求输出结构化字段、是否涉及跨页引用。
评测集必须自建,公开榜单的分数不能直接迁移到自己的业务上。通用评测多考常识性描述,而实际任务往往考字段值、单位、版面和否定表达。做法是准备一份覆盖典型场景与边界样例的黄金集,用字段级准确率和人工复核通过率作为上线门槛,而不是看模型排行榜的名次。
延迟与吞吐的配置要在调用模型之前完成一大半。图像的分辨率归一、去噪、裁剪、方向校正放在客户端或前置服务做,比交给模型侧做更省也更稳;批量任务走异步队列并允许重试,实时任务则限制单次图像数量,并设置超时后降级到纯文本兜底。
涉及证件、人脸、医疗影像和未脱敏工单的图文数据,不应直接送入外部多模态模型,这是合规边界而非性能取舍。常见做法是在本地部署小参数视觉模型完成检测、裁切与脱敏,只把脱敏后的区域或结构化文本送出,原始图像留在内网,同时保留调用日志以便追溯。
成本构成里视觉特征通常是最大变量,控制分辨率是最大杠杆。同一张图在不同分辨率下产生的特征数量差异明显,把图片按内容分区处理——文字区提高清晰度、背景区降采样——往往能在准确率基本不变的前提下压降单次调用开销。这条优化比换模型更容易见效,也更少引入新的不确定性。
有一部分图文任务根本不该用多模态模型。当图像信息可以稳定地先转成结构化文本,且后续判断只依赖这些字段时,纯文本模型更便宜、更稳、也更容易做单元测试。把多模态能力用在必须看到像素才能判断的环节,才是它的合理位置,否则只是用更高的成本换取更差的确定性。
落地顺序建议三步:先用黄金集验证每个环节的专用模型是否达标,再搭建路由与两级投递结构,最后把图像预处理和脱敏前置到调用之前。反过来先选定一个大模型再倒推任务拆分,通常会在密集文字识别和成本两项上同时受限,返工成本也更高。