搭建一套零成本的模型A/B测试流水线——用大模型评测大模型
·
模型评测最大的痛点是什么?人工看。200条输出一条条看,至少两小时,而且不同人打分标准不一样。后来我发现一个很讨巧的方法——让大模型当裁判,去评其他大模型的输出。不需要人工参与,不需要买评测工具,在TokenStar上就能跑通。
评测流水线的四步
· 准备50条你自己的业务数据(客服对话/产品描述/代码片段,什么都可以)
· 同一条数据同时发给两个模型——比如DeepSeek V4和GPT-5.4,拿到两份输出
· 让Claude当裁判盲评——把两份输出和原始问题发给Claude,"你觉得哪份更好?1-5分,说明理由"
· 统计50条结果——谁赢得多,差距有多大
我们用这个方法对比了DeepSeek和GPT在中文客服场景的表现——Claude给出的评分中DeepSeek赢了28次、GPT赢了18次、4次平手。和后来人工复评的结论高度一致(相关系数0.86)。整个过程花了约10分钟,如果人工做至少要两小时。总成本——几十次API调用,不到一美元。
自动化扩展
|
组件 |
实现 |
成本 |
|
测试数据管理 |
存为JSON格式,版本化管理 |
免费 |
|
被测模型调用 |
TokenStar API统一调用,改model参数切换 |
API费用 |
|
裁判模型调用 |
Claude Opus评分(最稳的判断力) |
API费用 |
|
结果统计与可视化 |
Python脚本自动生成对比报告 |
免费 |
TokenStar的地址是 tokenstar.world,上面能同时调用评测所需的所有模型——DeepSeek当选手、Claude当裁判——同一个平台全搞定。
更多推荐

所有评论(0)