9月13日·星期日 10:00·来源:InfoQ

Read, Don't Write: 重塑大模型评价体系,构建全自动、可进化的“探测式”评测管线|QCon上海

阿里巴巴高级技术专家孙鹏将在2026年QCon上海站“AI Agent可观测与持续改进工程”专题中分享《Read, Don't Write:重塑大模型评价体系》。针对传统生成式LLM-as-a-Judge面临的高成本、高延迟及字数偏置、中心化偏置等问题,他提出“探测式评测”范式BoRP,通过读取模型隐状态中的满意度信号替代生成评语,结合对比表示提取与PLS回归,评测成本降低97%,人类对齐度超越传统生成式Judge。该方案已在万亿级流量A/B测试中落地,支持单卡A100日处理百万级会话,仅需数百条标注即可达到Krippendorff's alpha 0.80信度。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→