【基于百宝箱工作流 + Rokid 眼镜的故宫文旅 AI 助手】
技术文档:基于百宝箱工作流 + Rokid 眼镜的故宫文旅 AI 助手
目录
1. 项目概述
1.1 项目背景
本项目旨在打造一个专注于北京故宫文旅的 AI 介绍助手,通过 Rokid AI 智能眼镜为终端,以支付宝百宝箱工作流为后端智能引擎,为游客提供沉浸式的景点讲解体验。
助手的核心能力:
- 图像识别:游客佩戴 Rokid 眼镜拍摄故宫建筑/文物,自动识别景点
- 意图理解:判断用户是否想了解故宫相关信息
- 名家风格讲解:结合老舍、朱自清、余秋雨、梁衡等名家文风,生成有深度、有温度的景点介绍
- 多模态交互:支持拍照提问 + 语音对话双通道
1.2 项目目标
- 功能目标:游客拍照即可触发故宫景点 AI 讲解,获得名家风格的沉浸式介绍
- 体验目标:讲解内容融合历史底蕴、文化内涵、民俗传统和文学典故
- 技术目标:百宝箱工作流编排 + Rokid 眼镜端侧调用,全链路低延迟
- 商业目标:可发布至支付宝小程序 + Rokid 眼镜应用商店,触达双端用户
2. 平台与硬件介绍
2.1 支付宝百宝箱
百宝箱是蚂蚁集团推出的一站式 AI 原生应用开发平台(tbox.alipay.com),核心能力包括:
- 工作流编排:可视化拖拽节点,串联大模型、插件、知识库等,构建复杂 AI 流程
- 多模型支持:通义千问 Max、DeepSeek-R1 满血版、月之暗面、智谱 GLM、百灵等,免费无额度限制
- 插件生态:高德地图周边搜索、夸克搜索、支付宝支付、OCR 识别等 30+ MCP 服务
- 知识库:上传文档构建 RAG 知识库,让 AI 基于私有数据回答
- 一键发布:发布至支付宝小程序、应用广场、Web 应用等多端
工作流模式是百宝箱的核心开发方式,通过可视化节点编排实现复杂任务:
- 开始节点 → 收集用户输入
- 分支节点 → 条件路由
- 大模型节点 → 文本/图像理解与生成
- 插件节点 → 调用外部服务
- 结束节点 → 输出最终结果
2.2 Rokid Glasses
Rokid Glasses 是 Rokid 推出的全球最轻全功能 AI&AR 智能眼镜(49g),核心参数:
- 重量:49g(镁铝合金框架)
- 处理器:Qualcomm AR1 + NXP RT600 双芯片
- 摄像头:12MP Sony IMX681,109° 视场角,支持 LLHDR 夜景
- 显示:双眼单色 Micro LED 波导,480×398 分辨率,1500 nits
- 音频:双定向扬声器 + 4 麦克风阵列(AI 降噪)
- 内存/存储:2GB RAM / 32GB ROM
- 连接:蓝牙 5.3 + Wi-Fi 6
- 电池:210mAh(便携充电盒 3000mAh,支持 10 次充电)
- AI 能力:集成 ChatGPT/GPT-5,支持实时翻译、物体识别、语音助手
- SDK:Rokid CXR-M SDK(Android),开放眼镜端拍照、显示、语音等能力
3. 系统架构设计
3.1 整体架构
┌─────────────────────────────────────────────────────────────┐
│ 用户层(Rokid 眼镜) │
│ ┌───────────┐ ┌───────────┐ ┌───────────────────────┐ │
│ │ 语音输入 │ │ 拍照采集 │ │ Micro LED 显示/语音播报 │ │
│ │ (4-Mic) │ │ (12MP) │ │ (AR 投屏 + 扬声器) │ │
│ └─────┬─────┘ └─────┬─────┘ └───────────┬───────────┘ │
└────────┼──────────────┼────────────────────┼───────────────┘
│ │ │
▼ ▼ │
┌─────────────────────────────────────────────┼───────────────┐
│ 通信层(蓝牙 5.3 + Wi-Fi 6) │ │
└──────────────────────────────────────────────┼───────────────┘
│
┌─────────────────────────────────────┘
▼
┌─────────────────────────────────────────────────────────────┐
│ 百宝箱工作流引擎(云端) │
│ │
│ ┌──────┐ ┌──────┐ ┌──────────┐ ┌──────────┐ │
│ │ 开始 │───→│ 分支 │───→│ 意图识别 │───→│ 图片识别 │ │
│ │ 节点 │ │ 节点 │ │ (大模型) │ │ (图像大模型)│ │
│ └──────┘ └──────┘ └────┬─────┘ └────┬─────┘ │
│ │ │ │
│ ┌───────────────┘ │ │
│ ▼ ▼ │
│ ┌──────────────┐ ┌──────────────────┐ │
│ │ 拍照采集节点 │ │ 图像大模型节点 │ │
│ │ (Rokid MCP) │ │ (景点识别+讲解) │ │
│ └──────┬───────┘ └────────┬─────────┘ │
│ │ │ │
│ ▼ ▼ │
│ ┌──────────────────────────────────────────────┐ │
│ │ 文本大模型节点(名家风格讲解) │ │
│ │ 融合:历史底蕴 + 文化内涵 + 民俗传统 + 文学典故 │ │
│ │ 风格:老舍 / 朱自清 / 余秋雨 / 梁衡 │ │
│ └──────────────────────┬───────────────────────┘ │
│ │ │
│ ▼ │
│ ┌──────────────────────────────────┐ │
│ │ 结束节点(输出) │ │
│ └──────────────────────────────────┘ │
└─────────────────────────────────────────────────────────────┘
3.2 数据流转
用户语音/拍照 → Rokid 眼镜采集 → 蓝牙/Wi-Fi 传输到手机 →
百宝箱工作流 API → 分支节点路由 → 意图识别/图片识别 →
大模型生成讲解内容 → 返回 Rokid 眼镜 → AR 显示 + 语音播报
3.3 技术选型
- 终端 — Rokid Glasses:49g 轻量佩戴,12MP 摄像头,AR 显示,4-Mic 语音采集
- 通信 — 蓝牙 5.3 + Wi-Fi 6:低延迟双通道,蓝牙传控制信令,Wi-Fi 传媒体数据
- 工作流引擎 — 支付宝百宝箱:零代码可视化编排,多模型支持,插件生态丰富
- 图像理解 — 百宝箱图像大模型:支持图片输入,识别景点并生成描述
- 文本生成 — 百宝箱文本大模型(通义千问 Max / DeepSeek-R1):长文本生成能力强,支持复杂提示词
- 知识增强 — 百宝箱知识库(故宫文献资料):RAG 检索增强,确保讲解内容准确
- 眼镜端 SDK — Rokid CXR-M SDK:封装眼镜拍照、显示、语音等能力
- 端能力调用 — Rokid × gPass MCP:标准化调用眼镜端拍照、触控等能力
4. 工作流设计详解
4.1 工作流总览
在百宝箱中创建「工作流」类型应用,节点编排如下:
[开始节点] → [分支节点] → [图片识别] ──→ [图像大模型] → [文本大模型] → [结束节点]
→ [意图识别] → [拍照采集] ─→ [文本大模型] → [结束节点]
4.2 节点 1:开始节点
功能:收集用户输入,作为工作流的入口。
配置:
user_input(多行文本,选填):用户的语音输入文本(由 Rokid 眼镜 ASR 转写)user_image(图片上传,选填):用户通过 Rokid 眼镜拍摄的照片session_id(单行文本,选填):会话 ID,用于多轮对话上下文管理
用户可以通过语音提问(如"介绍一下太和殿"),也可以通过拍照触发识别。两种输入方式可同时存在。
4.3 节点 2:分支节点
功能:根据用户输入类型进行路由分发。
分支条件:
- 条件 1:
user_image不为空 → 路由到图片识别节点(用户拍了照,优先走图像识别路径) - 条件 2:
user_input包含故宫相关关键词 → 路由到意图识别节点(用户语音提到了故宫相关内容) - 条件 3:
user_input不包含故宫关键词 → 路由到结束节点(引导语)(用户意图不明确,返回引导提示)
故宫关键词列表(在分支条件中配置):
故宫、紫禁城、太和殿、中和殿、保和殿、乾清宫、交泰殿、坤宁宫、
御花园、午门、神武门、东华门、西华门、角楼、九龙壁、珍宝馆、
钟表馆、书画展、故宫博物院、紫禁城...
4.4 节点 3A:图片识别节点(图像大模型)
功能:识别用户拍摄的故宫景点/文物照片。
模型选择:百宝箱图像大模型(支持视觉理解的通义千问 VL 或同类多模态模型)
输入:
user_image:引用开始节点的图片上传
提示词:
你是一个故宫文物与建筑识别专家。请识别用户上传的图片中的故宫景点或文物。
要求:
1. 识别图片中的建筑、文物或场景名称
2. 如果识别到故宫相关内容,输出:景点名称、所属区域、建筑年代
3. 如果不是故宫相关内容,输出"未识别到故宫相关内容"
4. 输出格式为 JSON:
{
"identified": true/false,
"name": "景点名称",
"area": "所属区域",
"era": "建筑年代",
"description": "简要描述(50字以内)"
}
输出变量:
image_recognition_result:JSON 格式的识别结果
4.5 节点 3B:意图识别节点(文本大模型)
功能:理解用户语音输入的意图,判断是否需要介绍故宫信息。
模型选择:通义千问 Max 或 DeepSeek-V3(响应速度快)
输入:
user_input:引用开始节点的用户语音文本
提示词:
你是一个意图识别助手。请分析用户的输入,判断其意图。
判断规则:
1. 如果用户想了解故宫的景点信息、历史、文化、游览攻略等,意图为 "introduce_gugong"
2. 如果用户想拍照识别当前看到的景点,意图为 "photo_recognize"
3. 如果用户问的是与故宫无关的问题,意图为 "irrelevant"
输出格式(JSON):
{
"intent": "introduce_gugong | photo_recognize | irrelevant",
"target": "用户想了解的具体景点或主题(如太和殿、故宫历史等)",
"confidence": 0.0-1.0
}
输出变量:
intent_result:JSON 格式的意图识别结果
4.6 节点 4:拍照采集节点(Rokid MCP 插件)
功能:当意图识别判断用户想拍照识别时,通过 Rokid 眼镜端 MCP 调用眼镜摄像头进行拍照。
插件配置:
- 插件来源:Rokid × gPass 端侧 MCP
- 调用能力:
glasses_take_photo - 参数:无(触发眼镜端拍照)
说明:此节点为可选增强节点。在当前架构中,用户已通过眼镜主动拍照(图片随开始节点上传),此节点用于在对话模式下主动触发拍照。
4.7 节点 5:图像大模型节点(景点讲解生成)
功能:基于图片识别结果,生成详细的景点讲解内容。
模型选择:通义千问 VL 或支持图像理解的多模态大模型
输入:
image_recognition_result:引用图片识别节点的输出user_image:原始图片(用于二次确认)- 知识库引用:故宫景点文献资料(RAG 检索增强)
4.9 节点 7:结束节点
功能:输出最终讲解内容。
配置:
- 输出变量:引用文本大模型或图像大模型的讲解内容
- 输出格式:纯文本(便于 Rokid 眼镜端 TTS 语音播报和 AR 显示)
5. 插件运用说明
5.1 插件清单
- 高德周边搜索(来源:百宝箱内置):搜索故宫周边停车场、美食、住宿。调用方式:在工作流中添加插件节点
- 夸克搜索(来源:百宝箱内置):联网搜索故宫最新信息(展览、门票)。调用方式:在工作流中添加插件节点
- 故宫知识库(来源:自建):RAG 检索故宫历史文献、建筑资料。调用方式:上传文档至百宝箱知识库
- Rokid 眼镜拍照(来源:Rokid × gPass MCP):调用眼镜端摄像头拍照。调用方式:MCP 端侧能力调用
- Rokid 眼镜显示(来源:Rokid × gPass MCP):在眼镜 AR 屏幕渲染卡片。调用方式:MCP 端侧能力调用
- Rokid 语音播报(来源:Rokid × gPass MCP):眼镜端 TTS 语音播放。调用方式:MCP 端侧能力调用
5.2 高德周边搜索插件配置
插件:高德服务 - 周边搜索
节点 1:
- address: "北京故宫博物院"
- keyword: "停车场"
- type: "停车场"
→ 输出:周边停车场列表
节点 2:
- address: "北京故宫博物院"
- keyword: "美食"
- type: "餐饮"
→ 输出:周边美食列表
节点 3:
- address: "北京故宫博物院"
- keyword: "住宿"
- type: "酒店"
→ 输出:周边住宿列表
5.3 故宫知识库构建
在百宝箱中创建知识库,上传以下类型文档:
- 故宫建筑资料:三大殿、后三宫、东西六宫等建筑详细介绍(PDF/Word)
- 故宫历史文献:明清两代紫禁城历史沿革(PDF/Word)
- 故宫文物图鉴:珍宝馆、钟表馆、书画展重点文物介绍(PDF/Word)
- 故宫游览攻略:推荐路线、开放时间、门票信息(Excel/Word)
- 名家散文选段:老舍、朱自清、余秋雨、梁衡关于故宫/北京的散文(TXT/Word)
知识库配置:
- 切片策略:按段落切片,每片 500-800 字
- 检索 Top-K:3(每次检索返回最相关的 3 个片段)
- 检索模式:语义检索
5.4 Rokid 端侧 MCP 插件
Rokid 与蚂蚁集团 gPass 合作,将眼镜端能力封装为标准化 MCP 服务:
- 眼镜拍照 — 接口名
glasses_take_photo:触发眼镜端摄像头拍照,返回图片 URL - 镜腿触控 — 接口名
glasses_touch_event:监听镜腿触控手势(单击/双击/滑动) - AR 显示 — 接口名
glasses_render_card:在眼镜 AR 屏幕渲染自定义卡片 UI - 语音播报 — 接口名
glasses_tts:眼镜端 TTS 语音播放文本内容 - 语音采集 — 接口名
glasses_asr:眼镜端麦克风采集语音并转写为文本
在百宝箱工作流中,这些 MCP 能力以插件节点形式调用,无需编写原生代码。
6. 提示词设计
6.1 提示词设计原则
采用 CO-STAR 框架(Context、Objective、Style、Tone、Audience、Response):
- Context(背景):游客正在故宫游览,佩戴 Rokid 眼镜,需要即时讲解
- Objective(目标):生成有深度、有温度的景点介绍
- Style(风格):老舍/朱自清/余秋雨/梁衡,根据景点特征选择
- Tone(语气):专业但不学术,亲切但不轻浮,有文化底蕴
- Audience(受众):来故宫游览的普通游客(全年龄段)
- Response(格式):300-500 字纯文本,适合语音播报
6.2 风格选择策略
- 三大殿(太和殿、中和殿、保和殿) → 余秋雨风格:历史厚重感,王朝兴衰思辨
- 后三宫(乾清宫、交泰殿、坤宁宫) → 老舍风格:市井烟火气,宫廷生活故事
- 御花园、花园 → 朱自清风格:清新细腻,光影之美
- 角楼、城墙、门楼 → 梁衡风格:建筑之美,大气磅礴
- 珍宝馆、钟表馆 → 余秋雨风格:文物背后的文明思考
- 整体故宫介绍 → 梁衡风格:宏大叙事,建筑群壮阔
6.3 提示词模板变量
在百宝箱工作流中,提示词通过 {{变量名}} 引用上游节点输出:
{{input_xxx-user_input}} → 用户语音输入
{{image_model_xxx-recognition_result}} → 图片识别结果
{{knowledge_base_xxx-output}} → 知识库检索结果
{{plugin_xxx-output_0}} → 插件输出(如高德搜索结果)
7. Rokid 眼镜端集成方案
7.1 集成架构
┌──────────────────────────────────────────────┐
│ Rokid Glasses(眼镜端) │
│ │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ 语音采集 │ │ 摄像头 │ │ AR 显示 │ │
│ │ (4-Mic) │ │ (12MP) │ │ (MicroLED)│ │
│ └────┬─────┘ └────┬─────┘ └────┬─────┘ │
│ │ │ │ │
│ ┌────┴──────────────┴──────────────┴────┐ │
│ │ Rokid CXR-M SDK / gPass MCP │ │
│ └────────────────────┬───────────────────┘ │
└───────────────────────┼──────────────────────┘
│ 蓝牙 5.3 + Wi-Fi 6
▼
┌──────────────────────────────────────────────┐
│ 手机端(Android Companion App) │
│ │
│ ┌──────────┐ ┌──────────────────────┐ │
│ │ 蓝牙/Wi-Fi│ │ 百宝箱工作流 API 调用 │ │
│ │ 通信管理 │ │ (HTTP POST) │ │
│ └──────────┘ └──────────────────────┘ │
└──────────────────────────────────────────────┘
7.2 两种集成路径
路径 A:百宝箱直连(推荐,零代码)
通过 Rokid × gPass MCP 标准化接口,在百宝箱工作流中直接调用眼镜端能力:
- 在百宝箱 MCP 专区添加 Rokid 眼镜 MCP 服务
- 工作流中添加 Rokid MCP 插件节点
- 配置调用参数(拍照/显示/播报)
- 发布为支付宝小程序 → 在 Rokid 眼镜应用商店上架
优势:全程零代码,百宝箱可视化编排,一键发布
7.3 关键交互流程
场景:游客拍照识别太和殿
1. 游客佩戴 Rokid 眼镜,走到太和殿前
2. 语音说"Hi Rokid,拍一下这个建筑" 或 按镜腿拍照键
3. 眼镜拍照 → 12MP 图片通过 Wi-Fi 传到手机
4. 手机调用百宝箱工作流 API:
- 开始节点:user_image = [太和殿照片]
- 分支节点:user_image 不为空 → 走图片识别路径
- 图像大模型:识别为"太和殿"
- 文本大模型:生成余秋雨风格的太和殿讲解
- 结束节点:输出讲解文本
5. 手机收到讲解文本 → 通过 CXR-M SDK 推送到眼镜
6. 眼镜端:
- AR 显示:在 Micro LED 屏幕显示讲解卡片(景点名称 + 风格 + 内容摘要)
- TTS 播报:通过定向扬声器语音播报讲解内容
7. 游客听完讲解后可追问:"这个殿是哪年建的?"
8. 语音输入 → ASR 转写 → 百宝箱工作流(意图识别 → 文本大模型 → 回答)
7.4 眼镜端 UI 渲染卡片设计
通过 gPass MCP 的 glasses_render_card 能力,在眼镜 AR 屏幕渲染卡片:
{
"card_type": "tour_guide",
"layout": "vertical",
"components": [
{
"type": "title",
"content": "太和殿"
},
{
"type": "tag",
"content": "余秋雨风格"
},
{
"type": "text",
"content": "站在这太和殿前,六百年的风雨从眼前掠过...",
"max_lines": 5
},
{
"type": "divider"
},
{
"type": "hint",
"content": "说"继续"听完整讲解,或拍照识别下一个景点"
}
]
}
8. 技术方案说明
8.1 模型选择策略
- 图片识别 — 推荐模型:通义千问 VL;备选模型:GPT-4o(如百宝箱支持)。理由:多模态理解能力强,中文景点识别好
- 意图识别 — 推荐模型:DeepSeek-V3;备选模型:通义千问 Turbo。理由:响应速度快,推理能力强
- 文本讲解生成 — 推荐模型:通义千问 Max;备选模型:DeepSeek-R1 满血版。理由:长文本生成质量高,文学风格表达好
- 知识库检索 — 推荐模型:百宝箱内置 RAG。理由:与百宝箱深度集成,无需额外部署
8.2 知识库 RAG 增强
为确保讲解内容的历史准确性,采用 RAG(检索增强生成)策略:
用户问题/图片识别结果
→ 百宝箱知识库语义检索(Top-3 相关文档片段)
→ 检索结果作为上下文注入大模型提示词
→ 大模型基于知识库内容生成讲解(确保准确)
→ 融合名家风格输出
8.3多轮对话支持
在百宝箱工作流中设置为对话模式(而非任务模式),支持多轮对话:
- 第 1 轮 — 用户:“介绍一下太和殿” → 系统行为:意图识别 → 文本大模型生成讲解
- 第 2 轮 — 用户:“这个殿是哪年建的?” → 系统行为:上下文继承 → 意图识别(追问)→ 知识库检索 → 回答
- 第 3 轮 — 用户:“旁边那个殿是什么?” → 系统行为:意图识别 → 引导拍照或文字描述 → 回答
9. 部署与发布
9.1 百宝箱端部署
步骤 1:登录百宝箱(tbox.alipay.com)
→ 使用支付宝扫码登录
步骤 2:新建应用
→ 应用类型:对话型
→ 构建方式:工作流
→ 应用名称:故宫文旅AI助手
→ 上传 Logo
步骤 3:编排工作流
→ 按第 4 节设计拖拽节点、配置连线
→ 配置各节点提示词和模型
→ 添加知识库、插件
步骤 4:测试
→ 点击"运行"测试工作流
→ 输入测试用例验证各分支
步骤 5:发布
→ 点击"发布" → 勾选发布渠道
→ 发布到支付宝小程序
→ 上架审核
9.2 Rokid 眼镜端部署
通过 gPass 上架
步骤 1:在百宝箱 MCP 专区添加 Rokid 眼镜 MCP 服务
步骤 2:在工作流中配置眼镜端 MCP 插件节点
步骤 3:发布应用时选择"Rokid 眼镜应用商店"
步骤 4:在 Rokid 开放平台(open.rokid.com)完成应用信息
步骤 5:上架审核 → 用户可在眼镜应用商店下载
更多推荐




所有评论(0)