做了六年数据库,我转型做了大模型评测
一个做了六年DBA的程序员,在云数据库托管让运维岗位越来越边缘化之后,在模型评测里找到了自己的新位置。
一、六年DBA,从核心岗位到边缘角色
2024年5月,我在一家互联网公司当DBA,六年工龄。管的是Oracle、MySQL、PostgreSQL三套数据库集群,日常就是监控、备份、调优、排障。
DBA这个岗位最辉煌的时候是2015到2019年。那时候数据库是公司的命脉,一个慢查询能让整个系统瘫痪,一次数据丢失能让公司关门。DBA是离数据最近的人,也是出事时第一个被叫起来的人。
“凌晨三点数据库主从延迟了,你赶紧看一下。”
这是我前几年最常接到的电话。有时候一个月能被叫起来四五次,顶着黑眼圈排查主从同步延迟、锁等待、连接数暴涨这些问题。辛苦,但有存在感——没有你,系统就崩了。
但从2022年开始,风向变了。公司把数据库迁到了云上——AWS RDS、阿里云PolarDB。云数据库自带高可用、自动备份、自动扩容、性能监控面板。以前我花一天做的容灾演练,云上点一下按钮就完成了。以前我半夜起来处理的主从延迟,云数据库的自动故障转移三分钟搞定。
DBA团队从6个人缩到了3个人。留下的人也不做"数据库管理"了,更多是在做数据库选型咨询和SQL审查——但说实话,这些活儿一年也没几次。
2024年中的时候,我做了一个盘点:过去三个月,我真正在干的"DBA核心工作"占比不到30%。剩下70%的时间,我在帮开发团队写SQL、做数据导出、配数据库连接——这些活儿一个后端开发自己就能干。
薪资两万四,三年没涨。不是我不够好,是岗位本身在贬值。数据库还是那个数据库,但管数据库这件事,不需要专门一个人了。
我需要找个新方向。
二、一个偶然的机会,模型评测缺人
转型的契机来得有点偶然。
2024年8月,公司的算法团队在做一个垂直领域的大模型微调。模型训练完了,效果好不好得测——但算法团队没人专门做评测。他们找了几个人手动跑了几百条测试题,人工打分,然后做了个准确率统计。
结果出来后被业务方质疑了:
“你们的评测题覆盖了多少场景?测试数据有没有泄露到训练集里?打分标准是什么?同一个人前后打分一致吗?这些问题你们想过吗?”
算法团队的Leader被问得哑口无言。他的团队擅长训练模型,但不擅长做系统化的评测。他们需要一个人来搭一套靠谱的评测体系。
不知道谁提了一嘴:“DBA不是天天做数据质量管理吗?让他们来搞评测数据呗。”
就这样,这个活儿落到了我头上。我当时觉得这就是个临时帮忙的活儿,没想到一做就做了大半年,最后变成了我的正式转型方向。
接手之后我才发现,模型评测这件事跟DBA的工作出奇地像。数据库需要监控性能指标、做慢查询分析、做版本对比、做容量规划。大模型也一样——需要监控质量指标、做错误分析、做版本对比、做能力评估。只不过监控的对象从"数据库"变成了"大模型"。
“模型也是一种数据系统,需要监控、调优、质量保障。这是我做了六年DBA最本能的反应。”
我跟算法Leader说了这句话,他觉得有道理,但从没从这个角度想过。
三、搭一套评测体系,从零开始的硬仗
2024年9月到12月,我花了四个月从零搭了一套模型评测体系。过程比我想的难得多。
第一件事是设计评测基准。算法团队之前用的评测方法是"找几百道题,让模型答,人工打分"。这种方法的问题太多了:题目量太少不具统计意义、人工打分有主观偏差、不同版本的评测结果不可比(因为题目和打分人可能变了)。
我借鉴了MMLU和C-Eval的思路,设计了一套领域评测集。分成几步:先定义评测维度(事实准确性、逻辑推理、语言流畅度、安全性),每个维度下设计题目,题目按难度分级(简单/中等/困难),每道题标注领域标签和题型标签。
最关键的是建立标准答案和打分规则。选择题和填空题可以自动评分,但开放性问答题需要人工打分。我设计了一个5分制评分标准,每1分都有明确的定义和示例,减少打分人的主观偏差。还引入了双人打分+仲裁机制——两个人独立打分,分数差超过1分的题目交给第三个人仲裁。
这套体系跑起来之后,算法团队第一次有了"可信的"模型评测数据。
“以前我们说模型变好了,凭感觉。现在终于有数据支撑了。”
第二件事是搭自动化评测流水线。以前评测是手动的——把测试题一条一条喂给模型,手动记录回答,手动打分。几百道题两个人跑一天。我写了一套自动化pipeline:批量调用模型API、收集回答、自动评分(客观题)+辅助评分(主观题用GPT-4o做初筛打分,人工只复核分歧项)、生成统计报告。跑一次完整评测从一天缩短到二十分钟。
第三件事是模型版本对比。每次模型迭代后,用同一套评测集跑新旧两个版本,对比各维度的得分变化。我做了个可视化的对比报告,哪个维度提升了、哪个维度退步了,一目了然。有一次模型迭代后,总体准确率提升了2%,但安全维度的得分下降了5%——模型变得更"聪明"但也更"不安全"了。如果没有系统化评测,这种退化根本发现不了。
这些工作让我越来越确信一件事:模型评测本质上是"数据质量管理",只不过管理的对象从数据库里的数据变成了模型的输入输出。质量指标、版本管理、监控告警、回归测试——这些DBA做了一辈子的概念,在大模型评测里一个没少。
四、线上模型质量监控,DBA思维的直接迁移
2025年初,我的工作重心从"离线评测"扩展到了"线上监控"。
模型上线之后,不是评测一次就完事了。线上的真实用户问的问题是评测集覆盖不了的,模型的回答质量需要持续监控。这跟DBA监控数据库的线上运行状态是一个思路——数据库上线后你要监控慢查询、连接数、磁盘空间;模型上线后你要监控回答质量、用户满意度、异常输出。
我搭了一套线上质量监控系统,分几层。
第一层是用户反馈收集。在AI助手的回答下面加了"有用/无用"的反馈按钮,用户点击的数据自动收集。这是最直接的质量信号——用户说没用,大概率是真的没用。但用户反馈有偏差:满意的用户不点按钮,不满意的才点。所以我不能只看绝对值,要看趋势——如果某天的"无用"比例突然上升,说明模型可能出了问题。
第二层是自动质量评估。从线上对话里采样一部分,用GPT-4o做自动评分(跟离线评测的辅助评分一样的思路)。每天跑一次,生成质量趋势图。如果某天的平均分偏离正常区间,自动告警。
第三层是异常检测。有些异常是评测集测不出来的——比如模型突然开始输出重复内容、输出空回答、输出超长回答。这些异常通过规则引擎检测:回答长度异常、重复率异常、拒答率异常,触发即告警。
“你这个监控体系,跟我们监控数据库那套几乎一模一样。”
这是公司运维团队的一个老同事看完我做的监控系统后说的。他说得完全对——指标监控、趋势分析、异常告警、根因排查,这套方法论我在DBA岗位上用了六年,现在原封不动搬到了大模型评测上。
唯一的区别是监控的对象变了。以前监控的是QPS、延迟、连接数这些基础设施指标;现在监控的是准确率、安全性、用户满意度这些质量指标。但监控的方法论是一样的:定义指标 → 采集数据 → 设定基线 → 异常告警 → 根因分析。
五、大模型评测工程师在干什么
做了大半年,我对大模型评测工程师这个岗位有了比较全面的理解。日常工作分四大块。
第一块是评测基准设计。这是一切的基础。你需要定义"什么算好"——把模型的"好坏"拆解成可量化的维度,每个维度设计有代表性的题目。这套题集要覆盖模型的各项能力、要有难度区分、要防止数据泄露。设计一套好的评测集,跟设计一套好的数据库测试数据是同一个思路——覆盖边界条件、覆盖异常场景、覆盖正常流程。
第二块是自动化评测流水线。从模型推理到评分到报告生成,全流程自动化。这块的技术含量不高但工程量大——你要处理模型API的限流、超时、重试,要管理评测任务的并发和调度,要生成可视化的统计报告。做过后端运维的人,这套东西手到擒来。
第三块是人工评测标注平台。完全自动化的评测目前还做不到——主观题需要人工打分。我搭了一个标注平台:评测题随机分配给标注员、双人独立打分、分歧仲裁、标注一致性检查(用Cohen’s Kappa系数衡量标注一致性)。这套平台的设计思路,跟DBA做数据质量管理时的"数据校验流程"是一脉相承的。
第四块是线上质量监控。模型上线后的持续质量保障——用户反馈收集、自动质量评估、异常检测、版本回归。这套东西就是"模型运维",跟数据库运维的思路完全一样。
六、DBA的底层思维,在模型评测里直接复用
2025年9月,算法团队的Leader跟我做了一次正式的沟通,问我愿不愿意正式转岗到算法团队,岗位是"大模型评测工程师"。薪资涨到了三万二。
“以前我觉得评测是算法团队顺手做的事,做了大半年才发现,这需要一套系统工程,需要有人专门做。而你的DBA背景让你天然擅长这套东西。”
这是他的原话。他说的"系统工程"四个字,精准地概括了模型评测的本质——它不是一个算法问题,是一个工程问题。
如果你也是做DBA的,正在焦虑云数据库托管会不会让你失业,我的建议是:
DBA的核心能力不是"管数据库",是"数据质量管理"。这套能力在大模型评测里是直接可迁移的。
第一步,理解大模型评测的框架。去看看MMLU、C-Eval、MT-Bench这些评测集是怎么设计的——维度划分、题目设计、评分标准。你会发现这跟DBA做数据质量校验的思路高度相似:定义质量指标、设计测试用例、执行检测、生成报告。
第二步,搭一套自动化评测pipeline。找一个开源大模型(比如Qwen或者Llama),下载一个开源评测框架(比如OpenCompass或者lm-evaluation-harness),跑一次完整评测。理解从"输入测试题"到"输出评测报告"的完整流程。
第三步,学线上监控。DBA最擅长的就是监控——把这套能力迁移到模型质量监控上。定义模型的质量指标(准确率、安全性、用户满意度),搭监控面板,设告警阈值。你做了六年DBA积累的监控经验,在这里一天就能上手。
大模型也是一种数据系统。它需要被监控、被调优、被质量保障。而做这件事最好的人选,不是算法工程师——他们懂模型但不懂系统化质量管理;是DBA——我们做了一辈子的数据质量管理,这套思维方式是刻在骨子里的。
我就是那个做了六年Oracle和MySQL的DBA,现在管的东西从"数据库的性能指标"变成了"大模型的质量指标"。方法论没变,变的只是监控的对象。
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:

2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:

三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】

四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!
更多推荐



所有评论(0)