Java后端工程师:做了五年CRUD,我转型做了RAG应用开发
“这个接口三天后上线,用户问什么都能答。”
老板把需求文档拍到桌上的时候,我盯着封面上“AI知识库问答”五个字,手指在笔记本边缘抠出一道白印。我做了五年Java后端,Spring Cloud玩得熟,接口文档写得比谁都规范,但那一刻我脑子里只有一个念头:他问错人了。
“老王,RAG听说过吧?咱们知识库接大模型,你做。”
“RAG?”我嘴里重复了一遍,像是在确认发音。
“对,RAG。用Embedding把文档向量化了,用户问啥答啥。”他顿了顿,补了一句,“你不是一直做后端吗?这个也归你。”
我笑着点头,笑着走出会议室,笑着坐回工位,然后对着百度搜了十分钟“RAG是什么”。
一、那个把我问住的会,毁了我五年的自信
说实话,被问住的感觉挺熟悉。刚毕业那会儿,我也经常被架构师问住,但那是技术深度问题,回去看源码、写demo、调参数,总能补上。可这次不一样,不是某个框架不熟,是整个领域我都没踩进去过。
我做了五年CRUD,准确地说是五年半。Spring Boot、Spring Cloud、MySQL、Redis、RocketMQ、Elasticsearch,这些名词我闭着眼都能写进简历。微服务拆分、接口幂等、分布式事务、限流熔断,我处理过生产事故,也设计过高并发接口。但在那场会之前,我从来没想过“问答系统”这件事跟我有什么关系。
我们公司的知识库是个典型的企业Wiki,几万篇文档,产品说明、技术方案、运营SOP、客服话术全塞在里面。以前用户找东西,靠搜索框里输关键词,返回一堆标题,点进去自己翻。现在老板想让它像ChatGPT一样,直接给答案。
“不就是个接口吗?”我当时真这么想过。大模型API接一下,用户问题丢进去,答案返回来,跟调用第三方短信服务有什么区别?
我花了两个小时画了一个架构图:前端→后端→OpenAI API→返回。然后拿了一个真实问题去测:“我们的退货流程怎么走?”模型答得头头是道,但有一半内容是编的。它说“退货需要联系客服主管签字”,可我们公司根本没有这个流程。
老板看了demo,表情没变,只问了一句:“这就是你说的RAG?”
我才知道,RAG不是“调用大模型接口”。RAG是检索增强生成,是先把文档切分、向量化、存进向量数据库,用户提问时先检索相关片段,再把片段和问题一起喂给大模型。关键不是模型多聪明,是你喂给它的上下文准不准。
那天晚上我对着LangChain的官方文档看到凌晨三点。文档是英文的,例子是Python的,我连Embedding是什么都没搞清楚。我安慰自己:后端工程师学新技术,不就是看文档、写代码、跑通吗?可这次我连“跑通”的标准都不知道。
二、补课第一周,我像个刚毕业的学生
我先把RAG的链路拆开了。整个流程其实不复杂:文档加载、文本分块、Embedding、向量存储、检索、重排序、生成答案。难的是每个环节都有大量选择,而且每个选择都直接影响效果。
我先从Embedding开始。文档要变成向量,靠的是Embedding模型。我试了两个开源的:BGE和M3E。BGE-large-zh用下来,在我们的中文文档上检索准确率高一些;M3E更小、更快,但语义对齐差了点。我跑了一批测试,用Recall@K做指标,发现BGE在top-5的召回率能到78%,M3E只有62%。
然后是向量数据库。我先用FAISS跑demo,因为它轻量,本地就能起。数据量小的时候没问题,但公司几万篇文档一进去,索引更新、并发查询、元数据过滤都让我头大。后来切到Milvus,才算有点企业级的感觉。它支持分片、副本、混合检索,跟我们后端的存储系统思路很像。
“你这不就是再搭一个检索服务吗?”后端组的小李看我折腾了半天,凑过来说。
他说得对。RAG的底层,本质上是一个高可用的检索服务。只是这个服务的“查询”不是SQL,而是向量相似度;它的“索引”不是B+树,而是HNSW图索引;它的“结果”不是行记录,而是文本片段。
但这个“本质上”的背后,全是新东西。文本分块的策略:按字符切、按句子切、按语义切,chunk size设512还是1024,overlap要不要128?检索时top-k取多少?要不要做BM25+向量的混合检索?检索出来的结果要不要过reranker?我用bge-reranker试了一下,把top-10重排后取top-5,准确率又提升了12个百分点。
每一个参数都不是拍脑袋定的。我建了一个Excel,记录每次改动的配置和对应的Recall@K、MRR、答案相关性分数。我才发现,原来做RAG跟做后端压测一样,也需要指标体系,也需要ablation实验。
那一周我过得很狼狈。白天写代码,晚上看论文,周末抱着LlamaIndex的教程跑。我以前觉得自己是个“工程师”,现在觉得自己像个“调参学徒”。
三、第一个RAG项目,让我把后端能力嫁接到新领域
熬了两周,我总算交出了一个内部知识库问答demo。效果不算惊艳,但至少能答对大部分流程类问题了。老板看了之后,让我牵头做一个正式项目——给客服团队用的产品知识库问答。
这次我没有急着写代码。我先做了一件我最熟悉的事:拆需求、画架构、定义接口。
系统需要几个模块:文档接入层、Embedding服务、向量存储、检索服务、重排序服务、LLM网关、问答API。每个模块的输入输出、异常处理、限流策略、缓存策略,我都按后端系统的标准来设计。比如Embedding服务,如果模型推理慢,我就加Redis缓存;如果向量数据库挂了,我就走关键词检索的降级链路;如果LLM API超时,我返回“暂未找到答案”而不是让用户空等。
“你这个链路跟推荐系统有点像。”产品负责人 reviewing 架构图时说。
我愣了一下,然后点头。确实像。推荐系统是召回→粗排→精排→展示;RAG是检索→重排序→生成。召回靠Embedding,精排靠reranker,生成靠LLM。后端工程师做这种多层架构、数据流、降级策略,本来就是老本行。
我用LangChain搭了原型,后来因为业务逻辑复杂,改成LlamaIndex加自研组件。LangChain的链太“黑盒”,调试起来很痛苦。LlamaIndex的检索器、节点后处理器、响应合成器拆分得更清楚,适合我们这种需要深度定制的情况。
技术选型定了之后,我开始抠细节。chunk size最终定在512,overlap 128。这个配置下,既能保证语义完整,又不会让单个块里塞太多无关信息。向量检索用Milvus,HNSW索引,ef_construction设200,top-k先取20。然后BM25和向量做混合检索,权重向量0.7、关键词0.3。检索出来的20个候选片段,过bge-reranker重排,取top-5进LLM。
生成环节我也做了工程化。系统Prompt分两层:一层是通用的“你只能基于提供的上下文回答,不要编造”;另一层是业务层的,比如客服话术风格、禁答范围。用户Prompt里把检索结果和原始问题拼接进去。最后调用一个开源的70亿参数模型,而不是直接依赖第三方API,原因是成本可控、数据不出域。
项目上线那天,我在监控大屏前坐了两个小时。P99延迟380ms,QPS稳定,显存占用在预期范围内。客服团队反馈,平均检索问题从翻5分钟文档变成问一句话出答案。那一刻,我找回了点后端工程师的成就感。
四、RAG不是终点,是系统工程的新入口
项目跑起来之后,我开始意识到RAG的难点不在“有没有大模型”,而在“整个系统能不能持续变好”。
第一个挑战是数据更新。公司文档天天改,Wiki今天新增明天删除,向量库里的数据必须同步。我设计了一个增量更新Pipeline:监听文档变更事件→重新分块→重新Embedding→更新Milvus索引→记录版本。这个Pipeline我用Kafka做事件队列,用Celery做异步任务,跟我们后端的任务调度一模一样。
第二个挑战是评估。RAG的效果怎么量化?我们内部定了几个指标:检索阶段用Recall@5、MRR;生成阶段用RAGAS的faithfulness和answer_relevancy;人工抽检每周100条,打分。最痛苦的是人工评估,一开始三个人打分,同一条答案分数能差两个档次。后来我们定义了评分细则,什么算“事实准确”、什么算“答非所问”,Kappa一致性系数从0.4提到了0.72。
第三个挑战是幻觉。不管检索做得多好,LLM还是会偶发编造。我在链路里加了护栏:如果检索结果为空,直接拒绝回答;如果答案里出现文档里没有的实体,标记为待核实;如果用户问的是政策类问题,必须引用原文。这些策略不是模型能力,是工程能力。
“你现在说话怎么跟算法同学一样了?”我媳妇问我。
我没法解释。做RAG做久了,你会发现自己一半时间在搞检索,一半时间在搞工程,还有一小半时间在跟业务部门吵架——他们总觉得“AI应该什么都知道”。
五、转型半年,我终于看懂了自己的位置
现在回头看,那次会议室里的尴尬反而是个好起点。它逼着我从一个“只会调接口”的后端工程师,变成了一个能做完整RAG系统的应用开发工程师。
我现在的日常工作大概是这样:上午跟业务对需求,拆解哪些问题适合RAG、哪些不适合;下午调检索策略,比如尝试新的Embedding模型或重排序模型;晚上写代码,优化Pipeline或接口性能。偶尔还要跟算法团队对齐,讨论微调模型对我们场景有没有必要。
我的优势也逐渐清晰。五年的后端经验让我对系统边界、异常处理、并发控制很敏感。比如RAG系统里,Embedding推理是CPU密集型的,LLM生成是GPU密集型的,检索服务是IO密集型的,我能把这三类负载合理拆分,不会让某个环节成为瓶颈。这是刚毕业做算法的同学不容易具备的视角。
但我短板也很明显。我对NLP底层、模型训练、分布式训练框架理解不深。遇到需要精调模型或者设计新模型结构的问题,我还是得依赖算法同事。我给自己的定位是:懂工程、懂检索、懂业务落地,不跟算法专家拼模型深度,跟他们拼系统完整度。
六、如果你也是Java后端,想转RAG,我的建议
第一,别从“大模型”开始学,从“检索”开始学。RAG的核心是检索,不是生成。先把向量检索、文本分块、Embedding模型、重排序这几个概念跑通。你可以用LangChain或LlamaIndex搭一个本地知识库问答,这是最快的入门路径。
第二,把后端能力迁移过去。API设计、并发控制、缓存、降级、监控、日志,这些在RAG系统里全都需要。你五年的CRUD经验不是白费的,它是你做系统级RAG的底座。
第三,建立一个评估体系。RAG不像传统接口,对错不是0和1。你要学会用Recall@K、MRR、faithfulness、answer_relevancy这些指标说话,也要学会人工评估和自动化评估结合。没有评估的优化,都是玄学。
第四,选一个开源Embedding模型和一个向量数据库深入用。BGE、M3E、FAISS、Milvus、Qdrant,挑一个组合,跑几个真实数据集,比看十篇论文都管用。
第五,接受自己不是“AI专家”这件事。RAG应用开发工程师的不可替代性,不是你会训模型,而是你能把模型、检索、工程、业务串成一个能上线的系统。这个系统能稳定、可维护、可评估、能赚钱,就是你的护城河。
我现在的简历上,Java后端那五年还是排在前面。只是后面多了一行:负责公司RAG知识库问答系统,日均查询量X万,P99延迟XXXms,检索准确率XX%。
这行字,是我从会议室里那个只会点头的人,变成现在能独当一面的人,最好的证据。
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:

2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:

三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】

四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!
更多推荐

所有评论(0)