模型评测最大的痛点是什么?人工看。200条输出一条条看,至少两小时,而且不同人打分标准不一样。后来我发现一个很讨巧的方法——让大模型当裁判,去评其他大模型的输出。不需要人工参与,不需要买评测工具,在TokenStar上就能跑通。

评测流水线的四步

·        准备50条你自己的业务数据(客服对话/产品描述/代码片段,什么都可以)

·        同一条数据同时发给两个模型——比如DeepSeek V4和GPT-5.4,拿到两份输出

·        让Claude当裁判盲评——把两份输出和原始问题发给Claude,"你觉得哪份更好?1-5分,说明理由"

·        统计50条结果——谁赢得多,差距有多大

我们用这个方法对比了DeepSeek和GPT在中文客服场景的表现——Claude给出的评分中DeepSeek赢了28次、GPT赢了18次、4次平手。和后来人工复评的结论高度一致(相关系数0.86)。整个过程花了约10分钟,如果人工做至少要两小时。总成本——几十次API调用,不到一美元。

自动化扩展

组件

实现

成本

测试数据管理

存为JSON格式,版本化管理

免费

被测模型调用

TokenStar API统一调用,改model参数切换

API费用

裁判模型调用

Claude Opus评分(最稳的判断力)

API费用

结果统计与可视化

Python脚本自动生成对比报告

免费

TokenStar的地址是 tokenstar.world,上面能同时调用评测所需的所有模型——DeepSeek当选手、Claude当裁判——同一个平台全搞定。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐