长文本任务该选什么模型?长文档分析、合同审查、文献检索三种场景的适用边界怎么划
长文本模型没有普适首选:跨章节归纳用长上下文模型,金额与期限这类确定性抽取交给结构化输出加规则,文献证据检索用向量召回加重排再交长上下文综合。判断合格与否,看中段信息召回是否稳定、结论能否溯源到原文、单次有效任务成本是否在预算内。
长文本任务不存在单一最优模型,正确的做法是按任务分三档:跨章节全局理解选长上下文模型,条款与字段的确定性抽取用小窗口加结构化输出,文献证据检索用向量召回加重排再交给长上下文做综合。分档的判定依据是答案是否需要跨越文档多个位置且允许一定容错;不适用的情况是需要逐字比对金额、日期、编号的任务,那类任务必须回到规则与结构化抽取,不能交给模型自由发挥。
上下文窗口的标称长度不等于可用长度,这是长文本选型的第一道分水岭。原因是注意力机制对文档中段信息的召回通常低于首尾,也就是常说的中段失忆;做法是拿自己的真实文档做位置扰动测试,把关键条款轮流放在开头、中间、末尾,看模型能否稳定命中。窗口数字再大,中段命中率上不去,就不适合作为审查主力。
长文档分析的适用边界是“需要跨章节归纳、允许人工复核”,典型任务是制度梳理、研报摘要、多份纪要合并。判断标准是可摘引性,模型给出的结论要能指回原文段落;不适用的是需要精确数值汇总的场景,例如把几十份报表的数字加总。做法是先按章节切块生成局部摘要,再用一次长上下文调用做全局合并,成本与准确率都比直接把全文塞进窗口更可控。
合同审查只适合用长文本模型做初审定位,不适合替代终审结论。原因是合同风险点多为条款间的交叉引用与例外关系,模型能较快找出哪些条款互相矛盾,但对金额、期限、违约金比例的判断需要确定性抽取。做法是把条款抽成结构化字段,包括主体、金额、期限、违约责任、解除条件,用模型做候选定位,再用规则或人工确认;这一步省掉的是检索与初筛成本,不是判断责任。
文献检索的正确分工是向量检索负责召回、长文本模型负责证据综合。原因是学术文本里同一概念存在大量同义表述,纯向量召回的假阳性偏高;做法是先用检索召回候选段落,再用重排模型精排,把排名靠前的十几段交给长上下文模型归纳,并要求逐条标注出处。不适用的是把整个语料库塞进窗口,既贵,又更容易漏掉关键证据。
长文本任务的成本不由输入字数线性决定,而是由注意力计算的复杂度与缓存命中率共同决定。原因是同一份长文档被反复提问时,重复计算前缀会成倍推高费用;做法是启用前缀缓存,把稳定不变的文档部分放在前缀位置,把变动的问题放在末尾,并在多次追问同一份合同时复用会话。评估单位成本时应看每完成一次有效任务的花费,而不是每百万 token 的单价。
延迟与准确率在长文本场景里通常不能同时最优,需要按任务性质排优先级。合同初审面对几十页文本,用户能接受较长等待,优先准确率;文献问答是交互式追问,优先首字延迟;长文档批量分析属于离线任务,优先单位成本。把这三类任务用同一个模型、同一套参数跑,结果一定是某一类体验被牺牲。
自建长文本评测集比看公开榜单更有用,评测集要围绕三种题型设计。第一种是针尖测试,把唯一事实藏在长文中段,检验基础召回;第二种是多跳问答,答案需要跨三个以上段落拼接;第三种是字段抽取,检验金额、日期、编号等结构化输出的准确率与格式稳定性。每种题型准备足够数量的真实样本,同一批样本跑不同候选模型,差异会立刻显现。
长上下文与检索增强不是二选一的关系,混合方案在生产环境里通常更稳。原因是检索负责把候选范围压到可控规模,长上下文负责跨段落推理,两者叠加能同时降低幻觉率与调用成本。做法是先用检索把文档压到窗口的合理占用比例,再让模型在标注来源的上下文中作答;只有确需全局视角的问题,才把完整文档交给长窗口。
可审计性在合同与文献场景里是硬约束,会直接改变选型结果。原因是这类产出必须能追溯到原文位置,还要满足数据处理边界要求;做法是优先选择支持结构化引用输出的模型,涉及敏感合同的场景选择可本地部署的开源权重模型,非敏感的长文档摘要类任务才用按量计费的商用接口。选型时应把能否给出可验证出处列为必选项,而不是加分项。
选型落地可以压缩成三个问题,按顺序回答就能定档。第一,答案是否需要跨多个位置拼接,如果不需要,规则或小窗口模型更快更便宜;第二,错误代价是否可逆,如果涉及金额与责任条款,必须保留人工确认环节;第三,单次任务的可接受成本是多少,用这个数字反推能用多长的上下文与多贵的模型。三个问题答完,候选范围通常只剩一到两个。
回到最初的问题,长文本模型没有普适首选,只有按场景分档的合适选择。跨章节理解与归纳交给长上下文模型,确定性抽取交给结构化输出加规则,证据检索交给向量召回、重排与长上下文综合的组合。判断一个候选模型是否合格,看它在自己的文档上能否稳定命中中段信息、能否给出可溯源出处、完成一次有效任务的成本是否在预算之内。