一、一份意外的Offer

2025年12月,我在V2EX上看到一个招聘帖:

“招Rust工程师,做大模型Agent基础设施,薪资50-80K。”

我做了三年Rust。高性能网络代理、嵌入式系统、WASM运行时——这些方向都做过。但"大模型Agent基础设施"是什么?当时完全没概念。

我抱着试试看的心态投了简历。面试的时候,技术负责人问了我一个问题:

“你觉得大模型Agent系统最缺什么?”

我说:“缺可靠性。大模型本身是不确定的,Agent要在这个不确定的基础上做决策,需要一整套可靠性保障机制。”

他眼睛亮了:“具体说说。”

我说:“我做了三年Rust,Rust的整个设计哲学就是’在编译期消除不确定性’。类型系统、所有权机制、错误处理——都是为了让程序在运行时不崩溃。大模型Agent系统面临的问题本质上是一样的:模型输出不确定、工具调用可能失败、多Agent协作可能死锁。这些都需要工程手段来兜底。”

他当场说:“你就是我们要找的人。”

那次面试之后,我开始认真研究大模型Agent开发。越研究越发现,这个方向跟Rust工程师的能力模型高度重合。


二、Rust工程师的困境

先说说为什么我开始找新机会。

Rust是一门好语言,这个毋庸置疑。但"Rust工程师"这个岗位在国内的处境很尴尬:

岗位少。 国内用Rust的公司不多,主要集中在:字节跳动的部分基础设施、PingCAP的TiKV、蚂蚁的Occlum、一些区块链公司。岗位数量跟Java、Go完全不是一个量级。

方向窄。 大部分Rust岗位集中在底层——数据库、操作系统、网络协议。这些方向技术门槛高,但市场天花板低。不像应用层开发,需求量大、天花板高。

成长慢。 底层方向的技术迭代速度慢,你三年前学的东西现在还能用。听起来是好事,但也意味着你的技术栈在"通货膨胀"——别人的技术在快速升值,你的在原地踏步。

2025年下半年,我开始认真考虑转型。但我不想扔掉Rust——三年积累的类型系统思维、内存安全意识、并发编程经验,扔掉太可惜了。

我需要找一个方向,能让我Rust经验发挥价值,同时又有足够的成长空间。

大模型Agent开发,恰好就是这个方向。


三、Agent开发到底在做什么

研究了一个月之后,我理清了Agent开发的核心技术栈:

第一层:Agent框架。 LangChain、LlamaIndex、AutoGen、CrewAI——这些是Agent开发的主流框架。但它们都是Python写的,适合原型验证,不适合生产环境。

为什么不适合?因为Python在以下场景中有硬伤:

  • 并发处理。 Agent系统需要同时管理多个Agent的执行,Python的GIL让真正的并行变得困难。
  • 内存安全。 Agent系统涉及大量的状态管理,Python的动态类型和GC不确定性,在生产环境中容易出问题。
  • 性能。 Agent的工具调用、状态序列化、消息传递,在高并发下Python的性能瓶颈很明显。

这恰好是Rust的强项。

第二层:工具调用基础设施。 Agent需要调用外部工具——API、数据库、文件系统、代码执行器。这些工具调用的管理——注册、发现、路由、错误处理、超时控制——本质上就是一个微服务框架。

Rust在这个领域有成熟的基础——tokio异步运行时、tonic gRPC框架、serde序列化。这些我用了三年,闭着眼睛都能写。

第三层:Agent状态管理。 Agent的执行是有状态的——当前在哪一步、之前的决策是什么、上下文是什么。这些状态需要持久化、可恢复、可追踪。

Rust的类型系统在这里有巨大优势。我可以把Agent的状态建模为代数数据类型(ADT),让编译器帮我检查状态转换的合法性。如果Agent不能从状态A直接跳到状态C,编译就会报错。这在Python里做不到。

第四层:多Agent协作。 多个Agent协作完成一个任务,涉及到消息传递、任务分配、冲突解决、死锁避免。这跟分布式系统的设计模式高度重合——而分布式系统正是Rust的舒适区。


四、我做了什么

想清楚之后,我做了三件事。

第一件事:用Rust写了一个Agent执行引擎。

不是从头造轮子。我参考了LangChain和AutoGen的设计思路,但用Rust重新实现了一个高性能的Agent执行引擎。

核心设计:

  • Agent抽象。 用Trait定义Agent接口——async fn execute(&self, input: AgentInput) -> Result<AgentOutput, AgentError>。每个Agent实现这个Trait,编译器保证类型安全。
  • 状态机。 Agent的执行状态用枚举建模——enum AgentState { Idle, Running, WaitingTool, WaitingLLM, Completed, Failed }。状态转换用模式匹配保证合法性,不可能出现非法状态转换。
  • 工具调用。 工具也是Trait——trait Tool { async fn call(&self, params: Value) -> Result<Value, ToolError> }。工具注册用Rust的类型系统做静态检查,工具调用用tokio做异步执行和超时控制。
  • 错误处理。 所有可能失败的操作都返回Result<T, E>。Agent执行失败不会panic,而是返回结构化错误,由上层决定重试还是降级。
  • 可观测性。 内置了tracing支持,每个Agent的执行过程都有结构化日志和tracing span。

这个引擎在性能测试中表现很好:单机可以同时运行1000+个Agent实例,每个Agent的工具调用延迟<1ms(不含LLM推理时间),内存占用比同等Python方案低80%。

第二件事:参与了一个开源Agent框架。

我在GitHub上找到了一个用Rust写的Agent框架项目——rig。当时还比较早期,star不多。我给它提了几个PR:

  • 实现了工具调用的超时和重试机制
  • 加了Agent状态持久化(用SQLite做存储后端)
  • 实现了简单的多Agent协作模式(Pipeline和Fan-out/Fan-in)

这些PR被maintainer merge了,后来我成了项目的committer。

开源社区的影响力比我预想的大。好几个公司通过GitHub找到我,问能不能用Rust帮他们做Agent基础设施。

第三件事:写了一系列技术博客。

我把"用Rust做Agent开发"的经验写成了系列博客,发在了知乎和掘金上:

  • 《为什么Agent系统需要类型安全》
  • 《用Rust的Trait系统设计Agent接口》
  • 《Agent状态管理:从Python到Rust》
  • 《大模型Agent的错误处理设计模式》

这些文章反响不错,单篇最高阅读量超过了2万。有几个技术社区转载了,还有人在Twitter上推荐。

这些博客后来成了我转型的"名片"。招聘方看了博客之后,不用我解释"Rust跟Agent开发有什么关系",他们自己就理解了。


五、转型之后

2026年1月,我正式加入了面试那家公司,title是"Agent基础设施工程师"。

工作内容跟我预想的不太一样——不是从零写Agent引擎,而是给公司的AI产品搭基础设施。

具体来说,公司有一个AI客服产品,用Python写的,基于LangChain。原型跑得很好,但上了生产环境之后问题不断:高并发下内存泄漏、Agent状态丢失、工具调用偶尔死锁、错误处理不完善。

我的任务是:用Rust重写Agent执行引擎的核心部分,把Python层只保留为业务逻辑和LLM调用。

这个工作做了三个月。重写之后:

  • 内存占用降低了75%(从每个Agent实例2MB降到0.5MB)
  • 单机并发Agent数从200提升到了2000
  • 工具调用的P99延迟从50ms降到了3ms
  • 运行时崩溃次数从每周3-4次降到了0

CTO看到这些数据的时候说了一句话:“这就是工程能力的差距。”


六、写在最后

我以前觉得,Rust工程师的护城河是"会写安全的系统级代码"。

现在我觉得,护城河是"类型系统思维"——用类型约束来消除不确定性,用编译期检查来替代运行时调试,用代数数据类型来建模复杂状态。

这种思维方式,在Agent开发里极其有价值。因为Agent系统本质上是"在不确定的基础上构建可靠的系统"——模型输出不确定、工具调用不确定、用户意图不确定。你需要用工程手段把这些不确定性约束住,让系统整体行为可控。

Rust工程师做了三年,训练出来的就是这种"跟不确定性作斗争"的能力。

如果你也在做Rust,也在担心岗位少、方向窄,我的建议是:去看Agent开发。大模型应用层正在从"原型验证"走向"生产部署",Python方案在性能和可靠性上的瓶颈越来越明显,市场需要能写出高性能、类型安全、内存安全的Agent基础设施的人。

而那个人,恰好就是你。

做了三年Rust,我以为自己选了一条路窄的语言。
现在发现,路窄是因为还没走到头。走到头了,就是一片没人占的地。

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

在这里插入图片描述

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

在这里插入图片描述

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

在这里插入图片描述

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

img

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

img

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

img

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

img

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

img

L5阶段:专题集丨特训篇 【录播课】

img
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐