怎么按任务类型拆分业务再组合多个大模型,单模型撑不住时该从哪一层开始换?
把业务按任务类型拆成感知、抽取、推理、生成、校验五类,再按每类任务对准确率、延迟、成本的要求分别选模型,是单模型转多模型组合的基本方法。任务类型没拆清就上多模型,只会同时抬高成本和排障难度,不适合日均调用量很低的场景。
把业务按任务类型拆开、再给每类任务单独匹配模型,是从单模型过渡到多模型组合的基本方法;任务高度同质、日均调用量很低时,多模型组合并不划算,反而会同时抬高集成成本和排障难度。单模型阶段的判断逻辑很简单:一个模型在各类任务上都不算太差,就用它。但业务跑到一定量级后,这个判断会失效,因为不同任务对准确率、延迟和单次成本的要求根本不在一个量级上。
拆分业务的第一步不是选模型,而是把现有调用日志按任务类型重新归类。判断标准是任务输出形态是否一致:回答一段话、抽出一组结构化字段、给出一个分类标签、判断一段文本是否合规,这四类任务对模型能力的要求差异很大。把日志按输入长度、输出长度、是否需要外部知识、是否要求确定性输出这四个维度打标,通常两三个小时就能看出业务真实的形态分布。
按任务类型拆分时,最实用的分法是把业务拆成感知、抽取、推理、生成、校验五层。感知层处理图片、音频、视频转文字这类跨模态输入;抽取层负责从文本里抠出结构化字段;推理层做多步判断和方案推演;生成层产出面向用户的自然语言;校验层检查前几层的输出是否符合业务规则。这个分法的意义在于,每层对模型的要求是可以独立定义的,不必用一个模型硬扛全部。
第一层可以替换的通常是抽取和分类任务,因为它们有明确的对错标准。字段抽取、意图分类、情绪判断、垃圾内容识别这类任务,用轻量模型往往就能达到接近大模型的效果,而且单次成本和延迟都低一个数量级。判断是否该换,看的是同一批测试样本上的准确率差距是否落在业务容错范围内,而不是看模型榜单排名。
第二层该保留强模型的是多步推理和长文本理解。需要跨多个文档比对、需要在长上下文里保持一致逻辑、需要输出带条件的方案时,轻量模型容易出现关键信息丢失,而且错误往往出现在推理链条中段,很难用后处理补回来。这类任务即使单价高,也应该留在能力强的模型上,因为一次错误结论带来的返工成本通常高于调用成本差。
第三层是生成层,它的选型逻辑和前两层不一样,主要看风格稳定性和输出长度。面向用户的文案、客服回复、摘要这类任务,如果风格漂移会直接影响体验,就需要一个在固定提示词下输出稳定的模型,而不是追求单次效果上限。生成层还适合做二次调用:先用轻量模型出草稿,再用强模型做润色或纠错,把强模型的用量集中在更小的输出上。
第四层是校验层,这是多模型组合里最容易被忽略、但收益最确定的一环。校验可以是一个规则引擎,也可以是一个只做判断不做生成的模型,它负责给前几层的输出打回或放行。把校验独立出来后,前面几层就可以放心使用更便宜的模型,因为错误在进入下游之前会被拦下来。校验层的关键指标不是准确率,而是漏放率,也就是有多少错误输出被误判为合格。
拆分和匹配都做完之后,才轮到路由。路由的常见做法有两种:一种是在请求入口按业务字段直接分流,比如表单类请求走抽取模型、对话类请求走生成模型;另一种是先做一次轻量意图判断,再决定后续调用哪个模型。前者实现简单、延迟可控,适合任务边界清晰的业务;后者灵活但会引入额外一次调用,适合任务类型混杂、无法在入口判断的场景。
多模型组合真正的成本不在调用单价,而在路由判断失误带来的连锁反应。路由把请求送错模型,往往不会立刻报错,而是产出一段看起来正常但业务上不可用的结果,最后靠人工发现。因此组合上线前必须准备一批带标注的回归样本,覆盖每类任务和常见的边界输入,每次调整路由规则或更换模型都跑一遍,关注的是错误率是否上升而不是单次响应快不快。
链式调用和并行调用是两种不同的组合结构,选错会让成本和延迟同时失控。链式调用适合后一步依赖前一步输出的任务,比如先抽取再推理再生成;并行调用适合多个模型独立处理同一输入、再汇总结果的任务,比如同时做事实核查和风格检查。把本可以并行的步骤串成链,会白白拉长响应时间;把强依赖的步骤并行处理,则会出现下游拿不到上游输出的情况。
监控维度需要跟着任务类型一起拆,否则多模型组合会变成黑盒。每类任务至少要记录三类指标:调用成功率、单位任务成本、以及业务侧的错误率。前两个指标用来发现路由或模型本身的异常,第三个指标用来判断组合是否真的比单模型更好。只盯调用成功率会漏掉最贵的故障,也就是调用全部成功但结果不可用。
多模型组合并不适合所有阶段。日均调用量低、任务类型单一、错误可以被人工兜底的业务,用单模型反而更省事,因为多一层路由就多一层维护成本。判断是否值得切换,可以看两个数字:一是不同任务对模型能力要求的差距是否明显,二是错误输出带来的返工成本是否高于调用成本的差距。两个都不满足时,保持单模型是更理性的选择。
落地时建议按任务类型分批替换,而不是一次性重构。先从抽取或分类这类有明确对错标准的任务开始换模型,跑通回归样本后再动生成层,最后才处理推理层。每一批替换后观察一到两周的业务错误率,确认没有上升再进入下一批。这样即使某个模型选错,影响范围也只限于一类任务,回退成本可控。