技术文档:基于百宝箱工作流 + Rokid 眼镜的故宫文旅 AI 助手


演示视频,点击查看详情

目录

  1. 项目概述
  2. 平台与硬件介绍
  3. 系统架构设计
  4. 工作流设计详解
  5. 插件运用说明
  6. 提示词设计
  7. Rokid 眼镜端集成方案
  8. 技术方案说明
  9. 部署与发布
  10. 风险与优化建议

1. 项目概述

1.1 项目背景

本项目旨在打造一个专注于北京故宫文旅的 AI 介绍助手,通过 Rokid AI 智能眼镜为终端,以支付宝百宝箱工作流为后端智能引擎,为游客提供沉浸式的景点讲解体验。

助手的核心能力:

  • 图像识别:游客佩戴 Rokid 眼镜拍摄故宫建筑/文物,自动识别景点
  • 意图理解:判断用户是否想了解故宫相关信息
  • 名家风格讲解:结合老舍、朱自清、余秋雨、梁衡等名家文风,生成有深度、有温度的景点介绍
  • 多模态交互:支持拍照提问 + 语音对话双通道

1.2 项目目标

  • 功能目标:游客拍照即可触发故宫景点 AI 讲解,获得名家风格的沉浸式介绍
  • 体验目标:讲解内容融合历史底蕴、文化内涵、民俗传统和文学典故
  • 技术目标:百宝箱工作流编排 + Rokid 眼镜端侧调用,全链路低延迟
  • 商业目标:可发布至支付宝小程序 + Rokid 眼镜应用商店,触达双端用户

2. 平台与硬件介绍

2.1 支付宝百宝箱

百宝箱是蚂蚁集团推出的一站式 AI 原生应用开发平台(tbox.alipay.com),核心能力包括:

  • 工作流编排:可视化拖拽节点,串联大模型、插件、知识库等,构建复杂 AI 流程
  • 多模型支持:通义千问 Max、DeepSeek-R1 满血版、月之暗面、智谱 GLM、百灵等,免费无额度限制
  • 插件生态:高德地图周边搜索、夸克搜索、支付宝支付、OCR 识别等 30+ MCP 服务
  • 知识库:上传文档构建 RAG 知识库,让 AI 基于私有数据回答
  • 一键发布:发布至支付宝小程序、应用广场、Web 应用等多端

工作流模式是百宝箱的核心开发方式,通过可视化节点编排实现复杂任务:

  • 开始节点 → 收集用户输入
  • 分支节点 → 条件路由
  • 大模型节点 → 文本/图像理解与生成
  • 插件节点 → 调用外部服务
  • 结束节点 → 输出最终结果

2.2 Rokid Glasses

Rokid Glasses 是 Rokid 推出的全球最轻全功能 AI&AR 智能眼镜(49g),核心参数:

  • 重量:49g(镁铝合金框架)
  • 处理器:Qualcomm AR1 + NXP RT600 双芯片
  • 摄像头:12MP Sony IMX681,109° 视场角,支持 LLHDR 夜景
  • 显示:双眼单色 Micro LED 波导,480×398 分辨率,1500 nits
  • 音频:双定向扬声器 + 4 麦克风阵列(AI 降噪)
  • 内存/存储:2GB RAM / 32GB ROM
  • 连接:蓝牙 5.3 + Wi-Fi 6
  • 电池:210mAh(便携充电盒 3000mAh,支持 10 次充电)
  • AI 能力:集成 ChatGPT/GPT-5,支持实时翻译、物体识别、语音助手
  • SDK:Rokid CXR-M SDK(Android),开放眼镜端拍照、显示、语音等能力

3. 系统架构设计

3.1 整体架构

┌─────────────────────────────────────────────────────────────┐
│                        用户层(Rokid 眼镜)                    │
│  ┌───────────┐  ┌───────────┐  ┌───────────────────────┐   │
│  │ 语音输入   │  │ 拍照采集   │  │ Micro LED 显示/语音播报 │   │
│  │ (4-Mic)   │  │ (12MP)    │  │ (AR 投屏 + 扬声器)     │   │
│  └─────┬─────┘  └─────┬─────┘  └───────────┬───────────┘   │
└────────┼──────────────┼────────────────────┼───────────────┘
         │              │                    │
         ▼              ▼                    │
┌─────────────────────────────────────────────┼───────────────┐
│                  通信层(蓝牙 5.3 + Wi-Fi 6) │               │
└──────────────────────────────────────────────┼───────────────┘
                                               │
         ┌─────────────────────────────────────┘
         ▼
┌─────────────────────────────────────────────────────────────┐
│              百宝箱工作流引擎(云端)                          │
│                                                             │
│  ┌──────┐    ┌──────┐    ┌──────────┐    ┌──────────┐     │
│  │ 开始  │───→│ 分支  │───→│ 意图识别  │───→│ 图片识别  │     │
│  │ 节点  │    │ 节点  │    │ (大模型)  │    │ (图像大模型)│     │
│  └──────┘    └──────┘    └────┬─────┘    └────┬─────┘     │
│                              │               │             │
│              ┌───────────────┘               │             │
│              ▼                               ▼             │
│  ┌──────────────┐               ┌──────────────────┐      │
│  │  拍照采集节点  │               │  图像大模型节点    │      │
│  │ (Rokid MCP)  │               │ (景点识别+讲解)    │      │
│  └──────┬───────┘               └────────┬─────────┘      │
│         │                                │                 │
│         ▼                                ▼                 │
│  ┌──────────────────────────────────────────────┐          │
│  │          文本大模型节点(名家风格讲解)          │          │
│  │  融合:历史底蕴 + 文化内涵 + 民俗传统 + 文学典故  │          │
│  │  风格:老舍 / 朱自清 / 余秋雨 / 梁衡            │          │
│  └──────────────────────┬───────────────────────┘          │
│                         │                                   │
│                         ▼                                   │
│  ┌──────────────────────────────────┐                      │
│  │          结束节点(输出)          │                      │
│  └──────────────────────────────────┘                      │
└─────────────────────────────────────────────────────────────┘

3.2 数据流转

用户语音/拍照 → Rokid 眼镜采集 → 蓝牙/Wi-Fi 传输到手机 → 
百宝箱工作流 API → 分支节点路由 → 意图识别/图片识别 → 
大模型生成讲解内容 → 返回 Rokid 眼镜 → AR 显示 + 语音播报

3.3 技术选型

  • 终端 — Rokid Glasses:49g 轻量佩戴,12MP 摄像头,AR 显示,4-Mic 语音采集
  • 通信 — 蓝牙 5.3 + Wi-Fi 6:低延迟双通道,蓝牙传控制信令,Wi-Fi 传媒体数据
  • 工作流引擎 — 支付宝百宝箱:零代码可视化编排,多模型支持,插件生态丰富
  • 图像理解 — 百宝箱图像大模型:支持图片输入,识别景点并生成描述
  • 文本生成 — 百宝箱文本大模型(通义千问 Max / DeepSeek-R1):长文本生成能力强,支持复杂提示词
  • 知识增强 — 百宝箱知识库(故宫文献资料):RAG 检索增强,确保讲解内容准确
  • 眼镜端 SDK — Rokid CXR-M SDK:封装眼镜拍照、显示、语音等能力
  • 端能力调用 — Rokid × gPass MCP:标准化调用眼镜端拍照、触控等能力

4. 工作流设计详解

4.1 工作流总览

在百宝箱中创建「工作流」类型应用,节点编排如下:

[开始节点] → [分支节点] → [图片识别] ──→ [图像大模型] → [文本大模型] → [结束节点]
                           → [意图识别] → [拍照采集]  ─→ [文本大模型] → [结束节点]

4.2 节点 1:开始节点

功能:收集用户输入,作为工作流的入口。

配置

  • user_input(多行文本,选填):用户的语音输入文本(由 Rokid 眼镜 ASR 转写)
  • user_image(图片上传,选填):用户通过 Rokid 眼镜拍摄的照片
  • session_id(单行文本,选填):会话 ID,用于多轮对话上下文管理

用户可以通过语音提问(如"介绍一下太和殿"),也可以通过拍照触发识别。两种输入方式可同时存在。

4.3 节点 2:分支节点

功能:根据用户输入类型进行路由分发。

分支条件

  • 条件 1:user_image 不为空 → 路由到图片识别节点(用户拍了照,优先走图像识别路径)
  • 条件 2:user_input 包含故宫相关关键词 → 路由到意图识别节点(用户语音提到了故宫相关内容)
  • 条件 3:user_input 不包含故宫关键词 → 路由到结束节点(引导语)(用户意图不明确,返回引导提示)

故宫关键词列表(在分支条件中配置):

故宫、紫禁城、太和殿、中和殿、保和殿、乾清宫、交泰殿、坤宁宫、
御花园、午门、神武门、东华门、西华门、角楼、九龙壁、珍宝馆、
钟表馆、书画展、故宫博物院、紫禁城...

4.4 节点 3A:图片识别节点(图像大模型)

功能:识别用户拍摄的故宫景点/文物照片。

模型选择:百宝箱图像大模型(支持视觉理解的通义千问 VL 或同类多模态模型)

输入

  • user_image:引用开始节点的图片上传

提示词

你是一个故宫文物与建筑识别专家。请识别用户上传的图片中的故宫景点或文物。

要求:
1. 识别图片中的建筑、文物或场景名称
2. 如果识别到故宫相关内容,输出:景点名称、所属区域、建筑年代
3. 如果不是故宫相关内容,输出"未识别到故宫相关内容"
4. 输出格式为 JSON:
{
  "identified": true/false,
  "name": "景点名称",
  "area": "所属区域",
  "era": "建筑年代",
  "description": "简要描述(50字以内)"
}

输出变量

  • image_recognition_result:JSON 格式的识别结果

4.5 节点 3B:意图识别节点(文本大模型)

功能:理解用户语音输入的意图,判断是否需要介绍故宫信息。

模型选择:通义千问 Max 或 DeepSeek-V3(响应速度快)

输入

  • user_input:引用开始节点的用户语音文本

提示词

你是一个意图识别助手。请分析用户的输入,判断其意图。

判断规则:
1. 如果用户想了解故宫的景点信息、历史、文化、游览攻略等,意图为 "introduce_gugong"
2. 如果用户想拍照识别当前看到的景点,意图为 "photo_recognize"  
3. 如果用户问的是与故宫无关的问题,意图为 "irrelevant"

输出格式(JSON):
{
  "intent": "introduce_gugong | photo_recognize | irrelevant",
  "target": "用户想了解的具体景点或主题(如太和殿、故宫历史等)",
  "confidence": 0.0-1.0
}

输出变量

  • intent_result:JSON 格式的意图识别结果

4.6 节点 4:拍照采集节点(Rokid MCP 插件)

功能:当意图识别判断用户想拍照识别时,通过 Rokid 眼镜端 MCP 调用眼镜摄像头进行拍照。

插件配置

  • 插件来源:Rokid × gPass 端侧 MCP
  • 调用能力:glasses_take_photo
  • 参数:无(触发眼镜端拍照)

说明:此节点为可选增强节点。在当前架构中,用户已通过眼镜主动拍照(图片随开始节点上传),此节点用于在对话模式下主动触发拍照。

4.7 节点 5:图像大模型节点(景点讲解生成)

功能:基于图片识别结果,生成详细的景点讲解内容。

模型选择:通义千问 VL 或支持图像理解的多模态大模型

输入

  • image_recognition_result:引用图片识别节点的输出
  • user_image:原始图片(用于二次确认)
  • 知识库引用:故宫景点文献资料(RAG 检索增强)

4.9 节点 7:结束节点

功能:输出最终讲解内容。

配置

  • 输出变量:引用文本大模型或图像大模型的讲解内容
  • 输出格式:纯文本(便于 Rokid 眼镜端 TTS 语音播报和 AR 显示)

5. 插件运用说明

5.1 插件清单

  • 高德周边搜索(来源:百宝箱内置):搜索故宫周边停车场、美食、住宿。调用方式:在工作流中添加插件节点
  • 夸克搜索(来源:百宝箱内置):联网搜索故宫最新信息(展览、门票)。调用方式:在工作流中添加插件节点
  • 故宫知识库(来源:自建):RAG 检索故宫历史文献、建筑资料。调用方式:上传文档至百宝箱知识库
  • Rokid 眼镜拍照(来源:Rokid × gPass MCP):调用眼镜端摄像头拍照。调用方式:MCP 端侧能力调用
  • Rokid 眼镜显示(来源:Rokid × gPass MCP):在眼镜 AR 屏幕渲染卡片。调用方式:MCP 端侧能力调用
  • Rokid 语音播报(来源:Rokid × gPass MCP):眼镜端 TTS 语音播放。调用方式:MCP 端侧能力调用

5.2 高德周边搜索插件配置

插件:高德服务 - 周边搜索
节点 1:
  - address: "北京故宫博物院"
  - keyword: "停车场"
  - type: "停车场"
  → 输出:周边停车场列表

节点 2:
  - address: "北京故宫博物院"
  - keyword: "美食"
  - type: "餐饮"
  → 输出:周边美食列表

节点 3:
  - address: "北京故宫博物院"
  - keyword: "住宿"
  - type: "酒店"
  → 输出:周边住宿列表

5.3 故宫知识库构建

在百宝箱中创建知识库,上传以下类型文档:

  • 故宫建筑资料:三大殿、后三宫、东西六宫等建筑详细介绍(PDF/Word)
  • 故宫历史文献:明清两代紫禁城历史沿革(PDF/Word)
  • 故宫文物图鉴:珍宝馆、钟表馆、书画展重点文物介绍(PDF/Word)
  • 故宫游览攻略:推荐路线、开放时间、门票信息(Excel/Word)
  • 名家散文选段:老舍、朱自清、余秋雨、梁衡关于故宫/北京的散文(TXT/Word)

知识库配置:

  • 切片策略:按段落切片,每片 500-800 字
  • 检索 Top-K:3(每次检索返回最相关的 3 个片段)
  • 检索模式:语义检索

5.4 Rokid 端侧 MCP 插件

Rokid 与蚂蚁集团 gPass 合作,将眼镜端能力封装为标准化 MCP 服务:

  • 眼镜拍照 — 接口名 glasses_take_photo:触发眼镜端摄像头拍照,返回图片 URL
  • 镜腿触控 — 接口名 glasses_touch_event:监听镜腿触控手势(单击/双击/滑动)
  • AR 显示 — 接口名 glasses_render_card:在眼镜 AR 屏幕渲染自定义卡片 UI
  • 语音播报 — 接口名 glasses_tts:眼镜端 TTS 语音播放文本内容
  • 语音采集 — 接口名 glasses_asr:眼镜端麦克风采集语音并转写为文本

在百宝箱工作流中,这些 MCP 能力以插件节点形式调用,无需编写原生代码。


6. 提示词设计

6.1 提示词设计原则

采用 CO-STAR 框架(Context、Objective、Style、Tone、Audience、Response):

  • Context(背景):游客正在故宫游览,佩戴 Rokid 眼镜,需要即时讲解
  • Objective(目标):生成有深度、有温度的景点介绍
  • Style(风格):老舍/朱自清/余秋雨/梁衡,根据景点特征选择
  • Tone(语气):专业但不学术,亲切但不轻浮,有文化底蕴
  • Audience(受众):来故宫游览的普通游客(全年龄段)
  • Response(格式):300-500 字纯文本,适合语音播报

6.2 风格选择策略

  • 三大殿(太和殿、中和殿、保和殿) → 余秋雨风格:历史厚重感,王朝兴衰思辨
  • 后三宫(乾清宫、交泰殿、坤宁宫) → 老舍风格:市井烟火气,宫廷生活故事
  • 御花园、花园 → 朱自清风格:清新细腻,光影之美
  • 角楼、城墙、门楼 → 梁衡风格:建筑之美,大气磅礴
  • 珍宝馆、钟表馆 → 余秋雨风格:文物背后的文明思考
  • 整体故宫介绍 → 梁衡风格:宏大叙事,建筑群壮阔

6.3 提示词模板变量

在百宝箱工作流中,提示词通过 {{变量名}} 引用上游节点输出:

{{input_xxx-user_input}}              → 用户语音输入
{{image_model_xxx-recognition_result}} → 图片识别结果
{{knowledge_base_xxx-output}}          → 知识库检索结果
{{plugin_xxx-output_0}}                → 插件输出(如高德搜索结果)

7. Rokid 眼镜端集成方案

7.1 集成架构

┌──────────────────────────────────────────────┐
│              Rokid Glasses(眼镜端)           │
│                                              │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐  │
│  │ 语音采集  │  │ 摄像头   │  │ AR 显示  │  │
│  │ (4-Mic)  │  │ (12MP)   │  │ (MicroLED)│  │
│  └────┬─────┘  └────┬─────┘  └────┬─────┘  │
│       │              │              │        │
│  ┌────┴──────────────┴──────────────┴────┐  │
│  │        Rokid CXR-M SDK / gPass MCP    │  │
│  └────────────────────┬───────────────────┘  │
└───────────────────────┼──────────────────────┘
                        │ 蓝牙 5.3 + Wi-Fi 6
                        ▼
┌──────────────────────────────────────────────┐
│            手机端(Android Companion App)     │
│                                              │
│  ┌──────────┐  ┌──────────────────────┐    │
│  │ 蓝牙/Wi-Fi│  │  百宝箱工作流 API 调用  │    │
│  │ 通信管理  │  │  (HTTP POST)         │    │
│  └──────────┘  └──────────────────────┘    │
└──────────────────────────────────────────────┘

7.2 两种集成路径

路径 A:百宝箱直连(推荐,零代码)

通过 Rokid × gPass MCP 标准化接口,在百宝箱工作流中直接调用眼镜端能力:

  1. 在百宝箱 MCP 专区添加 Rokid 眼镜 MCP 服务
  2. 工作流中添加 Rokid MCP 插件节点
  3. 配置调用参数(拍照/显示/播报)
  4. 发布为支付宝小程序 → 在 Rokid 眼镜应用商店上架

优势:全程零代码,百宝箱可视化编排,一键发布

7.3 关键交互流程

场景:游客拍照识别太和殿

1. 游客佩戴 Rokid 眼镜,走到太和殿前
2. 语音说"Hi Rokid,拍一下这个建筑"  或  按镜腿拍照键
3. 眼镜拍照 → 12MP 图片通过 Wi-Fi 传到手机
4. 手机调用百宝箱工作流 API:
   - 开始节点:user_image = [太和殿照片]
   - 分支节点:user_image 不为空 → 走图片识别路径
   - 图像大模型:识别为"太和殿"
   - 文本大模型:生成余秋雨风格的太和殿讲解
   - 结束节点:输出讲解文本
5. 手机收到讲解文本 → 通过 CXR-M SDK 推送到眼镜
6. 眼镜端:
   - AR 显示:在 Micro LED 屏幕显示讲解卡片(景点名称 + 风格 + 内容摘要)
   - TTS 播报:通过定向扬声器语音播报讲解内容
7. 游客听完讲解后可追问:"这个殿是哪年建的?"
8. 语音输入 → ASR 转写 → 百宝箱工作流(意图识别 → 文本大模型 → 回答)

7.4 眼镜端 UI 渲染卡片设计

通过 gPass MCP 的 glasses_render_card 能力,在眼镜 AR 屏幕渲染卡片:

{
  "card_type": "tour_guide",
  "layout": "vertical",
  "components": [
    {
      "type": "title",
      "content": "太和殿"
    },
    {
      "type": "tag",
      "content": "余秋雨风格"
    },
    {
      "type": "text",
      "content": "站在这太和殿前,六百年的风雨从眼前掠过...",
      "max_lines": 5
    },
    {
      "type": "divider"
    },
    {
      "type": "hint",
      "content": "说"继续"听完整讲解,或拍照识别下一个景点"
    }
  ]
}

8. 技术方案说明

8.1 模型选择策略

  • 图片识别 — 推荐模型:通义千问 VL;备选模型:GPT-4o(如百宝箱支持)。理由:多模态理解能力强,中文景点识别好
  • 意图识别 — 推荐模型:DeepSeek-V3;备选模型:通义千问 Turbo。理由:响应速度快,推理能力强
  • 文本讲解生成 — 推荐模型:通义千问 Max;备选模型:DeepSeek-R1 满血版。理由:长文本生成质量高,文学风格表达好
  • 知识库检索 — 推荐模型:百宝箱内置 RAG。理由:与百宝箱深度集成,无需额外部署

8.2 知识库 RAG 增强

为确保讲解内容的历史准确性,采用 RAG(检索增强生成)策略:

用户问题/图片识别结果 
  → 百宝箱知识库语义检索(Top-3 相关文档片段)
  → 检索结果作为上下文注入大模型提示词
  → 大模型基于知识库内容生成讲解(确保准确)
  → 融合名家风格输出

8.3多轮对话支持

在百宝箱工作流中设置为对话模式(而非任务模式),支持多轮对话:

  • 第 1 轮 — 用户:“介绍一下太和殿” → 系统行为:意图识别 → 文本大模型生成讲解
  • 第 2 轮 — 用户:“这个殿是哪年建的?” → 系统行为:上下文继承 → 意图识别(追问)→ 知识库检索 → 回答
  • 第 3 轮 — 用户:“旁边那个殿是什么?” → 系统行为:意图识别 → 引导拍照或文字描述 → 回答

9. 部署与发布

9.1 百宝箱端部署

步骤 1:登录百宝箱(tbox.alipay.com)
  → 使用支付宝扫码登录

步骤 2:新建应用
  → 应用类型:对话型
  → 构建方式:工作流
  → 应用名称:故宫文旅AI助手
  → 上传 Logo

步骤 3:编排工作流
  → 按第 4 节设计拖拽节点、配置连线
  → 配置各节点提示词和模型
  → 添加知识库、插件

步骤 4:测试
  → 点击"运行"测试工作流
  → 输入测试用例验证各分支

步骤 5:发布
  → 点击"发布" → 勾选发布渠道
  → 发布到支付宝小程序
  → 上架审核

9.2 Rokid 眼镜端部署

通过 gPass 上架

步骤 1:在百宝箱 MCP 专区添加 Rokid 眼镜 MCP 服务
步骤 2:在工作流中配置眼镜端 MCP 插件节点
步骤 3:发布应用时选择"Rokid 眼镜应用商店"
步骤 4:在 Rokid 开放平台(open.rokid.com)完成应用信息
步骤 5:上架审核 → 用户可在眼镜应用商店下载
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐