Rust三年,我转向了大模型Agent开发
一、一份意外的Offer
2025年12月,我在V2EX上看到一个招聘帖:
“招Rust工程师,做大模型Agent基础设施,薪资50-80K。”
我做了三年Rust。高性能网络代理、嵌入式系统、WASM运行时——这些方向都做过。但"大模型Agent基础设施"是什么?当时完全没概念。
我抱着试试看的心态投了简历。面试的时候,技术负责人问了我一个问题:
“你觉得大模型Agent系统最缺什么?”
我说:“缺可靠性。大模型本身是不确定的,Agent要在这个不确定的基础上做决策,需要一整套可靠性保障机制。”
他眼睛亮了:“具体说说。”
我说:“我做了三年Rust,Rust的整个设计哲学就是’在编译期消除不确定性’。类型系统、所有权机制、错误处理——都是为了让程序在运行时不崩溃。大模型Agent系统面临的问题本质上是一样的:模型输出不确定、工具调用可能失败、多Agent协作可能死锁。这些都需要工程手段来兜底。”
他当场说:“你就是我们要找的人。”
那次面试之后,我开始认真研究大模型Agent开发。越研究越发现,这个方向跟Rust工程师的能力模型高度重合。
二、Rust工程师的困境
先说说为什么我开始找新机会。
Rust是一门好语言,这个毋庸置疑。但"Rust工程师"这个岗位在国内的处境很尴尬:
岗位少。 国内用Rust的公司不多,主要集中在:字节跳动的部分基础设施、PingCAP的TiKV、蚂蚁的Occlum、一些区块链公司。岗位数量跟Java、Go完全不是一个量级。
方向窄。 大部分Rust岗位集中在底层——数据库、操作系统、网络协议。这些方向技术门槛高,但市场天花板低。不像应用层开发,需求量大、天花板高。
成长慢。 底层方向的技术迭代速度慢,你三年前学的东西现在还能用。听起来是好事,但也意味着你的技术栈在"通货膨胀"——别人的技术在快速升值,你的在原地踏步。
2025年下半年,我开始认真考虑转型。但我不想扔掉Rust——三年积累的类型系统思维、内存安全意识、并发编程经验,扔掉太可惜了。
我需要找一个方向,能让我Rust经验发挥价值,同时又有足够的成长空间。
大模型Agent开发,恰好就是这个方向。
三、Agent开发到底在做什么
研究了一个月之后,我理清了Agent开发的核心技术栈:
第一层:Agent框架。 LangChain、LlamaIndex、AutoGen、CrewAI——这些是Agent开发的主流框架。但它们都是Python写的,适合原型验证,不适合生产环境。
为什么不适合?因为Python在以下场景中有硬伤:
- 并发处理。 Agent系统需要同时管理多个Agent的执行,Python的GIL让真正的并行变得困难。
- 内存安全。 Agent系统涉及大量的状态管理,Python的动态类型和GC不确定性,在生产环境中容易出问题。
- 性能。 Agent的工具调用、状态序列化、消息传递,在高并发下Python的性能瓶颈很明显。
这恰好是Rust的强项。
第二层:工具调用基础设施。 Agent需要调用外部工具——API、数据库、文件系统、代码执行器。这些工具调用的管理——注册、发现、路由、错误处理、超时控制——本质上就是一个微服务框架。
Rust在这个领域有成熟的基础——tokio异步运行时、tonic gRPC框架、serde序列化。这些我用了三年,闭着眼睛都能写。
第三层:Agent状态管理。 Agent的执行是有状态的——当前在哪一步、之前的决策是什么、上下文是什么。这些状态需要持久化、可恢复、可追踪。
Rust的类型系统在这里有巨大优势。我可以把Agent的状态建模为代数数据类型(ADT),让编译器帮我检查状态转换的合法性。如果Agent不能从状态A直接跳到状态C,编译就会报错。这在Python里做不到。
第四层:多Agent协作。 多个Agent协作完成一个任务,涉及到消息传递、任务分配、冲突解决、死锁避免。这跟分布式系统的设计模式高度重合——而分布式系统正是Rust的舒适区。
四、我做了什么
想清楚之后,我做了三件事。
第一件事:用Rust写了一个Agent执行引擎。
不是从头造轮子。我参考了LangChain和AutoGen的设计思路,但用Rust重新实现了一个高性能的Agent执行引擎。
核心设计:
- Agent抽象。 用Trait定义Agent接口——
async fn execute(&self, input: AgentInput) -> Result<AgentOutput, AgentError>。每个Agent实现这个Trait,编译器保证类型安全。 - 状态机。 Agent的执行状态用枚举建模——
enum AgentState { Idle, Running, WaitingTool, WaitingLLM, Completed, Failed }。状态转换用模式匹配保证合法性,不可能出现非法状态转换。 - 工具调用。 工具也是Trait——
trait Tool { async fn call(&self, params: Value) -> Result<Value, ToolError> }。工具注册用Rust的类型系统做静态检查,工具调用用tokio做异步执行和超时控制。 - 错误处理。 所有可能失败的操作都返回
Result<T, E>。Agent执行失败不会panic,而是返回结构化错误,由上层决定重试还是降级。 - 可观测性。 内置了tracing支持,每个Agent的执行过程都有结构化日志和tracing span。
这个引擎在性能测试中表现很好:单机可以同时运行1000+个Agent实例,每个Agent的工具调用延迟<1ms(不含LLM推理时间),内存占用比同等Python方案低80%。
第二件事:参与了一个开源Agent框架。
我在GitHub上找到了一个用Rust写的Agent框架项目——rig。当时还比较早期,star不多。我给它提了几个PR:
- 实现了工具调用的超时和重试机制
- 加了Agent状态持久化(用SQLite做存储后端)
- 实现了简单的多Agent协作模式(Pipeline和Fan-out/Fan-in)
这些PR被maintainer merge了,后来我成了项目的committer。
开源社区的影响力比我预想的大。好几个公司通过GitHub找到我,问能不能用Rust帮他们做Agent基础设施。
第三件事:写了一系列技术博客。
我把"用Rust做Agent开发"的经验写成了系列博客,发在了知乎和掘金上:
- 《为什么Agent系统需要类型安全》
- 《用Rust的Trait系统设计Agent接口》
- 《Agent状态管理:从Python到Rust》
- 《大模型Agent的错误处理设计模式》
这些文章反响不错,单篇最高阅读量超过了2万。有几个技术社区转载了,还有人在Twitter上推荐。
这些博客后来成了我转型的"名片"。招聘方看了博客之后,不用我解释"Rust跟Agent开发有什么关系",他们自己就理解了。
五、转型之后
2026年1月,我正式加入了面试那家公司,title是"Agent基础设施工程师"。
工作内容跟我预想的不太一样——不是从零写Agent引擎,而是给公司的AI产品搭基础设施。
具体来说,公司有一个AI客服产品,用Python写的,基于LangChain。原型跑得很好,但上了生产环境之后问题不断:高并发下内存泄漏、Agent状态丢失、工具调用偶尔死锁、错误处理不完善。
我的任务是:用Rust重写Agent执行引擎的核心部分,把Python层只保留为业务逻辑和LLM调用。
这个工作做了三个月。重写之后:
- 内存占用降低了75%(从每个Agent实例2MB降到0.5MB)
- 单机并发Agent数从200提升到了2000
- 工具调用的P99延迟从50ms降到了3ms
- 运行时崩溃次数从每周3-4次降到了0
CTO看到这些数据的时候说了一句话:“这就是工程能力的差距。”
六、写在最后
我以前觉得,Rust工程师的护城河是"会写安全的系统级代码"。
现在我觉得,护城河是"类型系统思维"——用类型约束来消除不确定性,用编译期检查来替代运行时调试,用代数数据类型来建模复杂状态。
这种思维方式,在Agent开发里极其有价值。因为Agent系统本质上是"在不确定的基础上构建可靠的系统"——模型输出不确定、工具调用不确定、用户意图不确定。你需要用工程手段把这些不确定性约束住,让系统整体行为可控。
Rust工程师做了三年,训练出来的就是这种"跟不确定性作斗争"的能力。
如果你也在做Rust,也在担心岗位少、方向窄,我的建议是:去看Agent开发。大模型应用层正在从"原型验证"走向"生产部署",Python方案在性能和可靠性上的瓶颈越来越明显,市场需要能写出高性能、类型安全、内存安全的Agent基础设施的人。
而那个人,恰好就是你。
做了三年Rust,我以为自己选了一条路窄的语言。
现在发现,路窄是因为还没走到头。走到头了,就是一片没人占的地。
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:

2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:

三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】

四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!
更多推荐




所有评论(0)