用双模型互检提升推理准确率:生成模型输出步骤,验证模型挑错,配合多次采样投票,可减少逻辑跳跃和事实错误。
上周拿一道鸡兔同笼变体题测试驱动ams.aabbgg33.net,GPT-4间接算错。把它的推理轨范扔给Claude 3,后者指出“脚数差”那步假设错了。重新计较后谜底精确。

AI驱动AI推理就是用第二个模子当裁判,专盯逻辑漏洞了。详细操做分三个脚色的推理条记。生成模子负责写出残缺推理链。要求每步标注根据。考据模子拿到题目成绩成绩和推理链了,任务是逐条找矛盾,好比单元不统一、漏掉鸿沟前提,若是考据模子说“没成绩”,再让第三个模子随机抽检了。温度设0.3到0.7之间双模实操,太低会死板,太高会胡编的。
多次采样比单次靠谱了。统一道题让生成模子跑5次,获得5条推理途径,再让考据模子投票选出最分歧的功效。
上周处理合同条目比对。单模子精确率约72%,互检那套AI驱动AI推理流程把毛病率压到11%。价格是token耗损翻了三倍。留神别让生成和考据用统一个模子。我试过GPT-4自己检查自己,它会把毛病轨范解释成“合理近似”,根柢抓不出来。换成差异架构的模子,好比Llama 3考据GPT-4,挑错率较着上升。不要的,考据模子的提醉词要加一句“,若是你不肯定,间接说无法判断”。否则它会硬编理由。
那套方法合适数教证明、代码检查、执法条则查对。日常忙谈没需求。小我感应感染,AI驱动AI推理像请了两个较实的同事互相审稿,比一小我闷头干强,流程设念欠好会酿成踢皮球。先从小任务跑通。
再放年夜了。
文章版权声明:除非注明,否则均为本站原创,转载或复制请以超链接形式并注明出处。






