一、项目概述

在这里插入图片描述

1.1 项目名称

慧眼卫士(Wise Eye Guardian)

1.2 一句话 Slogan

慧眼识真伪,守护每一分养老钱

1.3 项目简介

慧眼卫士是一款运行在 AI 眼镜上的防骗智能体,专为老年群体设计。用户佩戴眼镜后,系统自动拍摄视野中的内容(新闻文章、保健品包装、宣传单等),通过多模态大模型直接识图分析,结合联网搜索验证,实时判断内容真伪和风险等级,并在高风险场景下自动通知家属,形成"识别-验证-预警-告警"的完整防护闭环。

1.4 解决的痛点

  • 老年人难以辨别朋友圈养生谣言、假新闻
  • 老年人容易被保健品骗局话术诱导
  • 子女无法实时陪伴父母识别骗局
  • 传统防骗手段依赖手机操作,老年人使用门槛高

1.5 核心创新

  • 零操作门槛:戴上眼镜自动识别,无需手动拍照、打字
  • 多模态直接识图:不依赖 OCR 管线,Qwen3-VL 一步完成"看图-提取-分析-生成建议"
  • 联网交叉验证:夸克搜索接入权威信源(卫健委、人民日报等),提升判定可信度
  • 家属告警闭环:高风险自动推送家属,形成远程防护

二、工作流设计

2.1 整体架构

基于蚂蚁百宝箱平台工作流编排,整体节点链如下:

[开始] → [gPass眼镜插件] → [图片质量预检] → [多模态大模型分析]
    → [夸克搜索联网验证] → [综合判定大模型] → [结果格式化与决策]
    → [家属推送] → [历史记录存储] → [结束]

2.2 设计原则

原则 说明
gPass 前置交给眼镜端 乐奇眼镜自动检测场景、自动对焦、自动拍照,工作流只处理 gPass 返回图片之后的逻辑
无知识库依赖 直接用多模态大模型看图分析,减少维护成本,提升泛化能力
纯处理链无分支 一条直线流程,降低调试复杂度,提升稳定性
无 TTS 节点 语音播报由眼镜端原生处理,工作流只输出结构化文字结果

在这里插入图片描述

在这里插入图片描述

2.3 节点详细说明

节点 1:开始
  • 接收参数:image_url(图片地址)、user_id(用户标识)、location(识别地点)
节点 2:gPass 眼镜插件(MCP)
  • 插件 ID:20260126z7IU06451341
  • 输入prompt_message = "正在识别,请保持眼镜对准目标"
  • 输出code(状态)、data(图片 URL)
  • 功能:触发眼镜拍照采集,返回图片数据地址
节点 3:图片质量预检(大模型)
  • 模型:Qwen3-VL
  • 温度:0.1
  • 功能:检测图片清晰度、文字可读性、是否对准目标
  • 输出quality_pass(是否合格)、suggestion(建议)
节点 4:多模态大模型分析(核心节点)
  • 模型:Qwen3-VL / qwen-vl-plus
  • 温度:0.3
  • 图片输入{{gPass眼镜插件.data}}
  • 功能
    1. 自动判断内容类型(新闻文章 / 保健品包装 / 药品包装 / 宣传单)
    2. 提取图片全部文字
    3. 识别风险特征(根治、包治百病、冒充专家、紧迫话术等)
    4. 初步判断可疑程度
  • 输出content_typeextracted_textrisk_flagspreliminary_risk
节点 5:夸克搜索联网验证(MCP)
  • 搜索词{{多模态大模型分析.extracted_text}} 辟谣 真相 官方
  • 站点过滤:nhc.gov.cn, people.com.cn, xinhuanet.com, cctv.com, samr.gov.cn
  • 功能:联网搜索权威信源,交叉验证内容真伪
节点 6:综合判定大模型
  • 模型:DeepSeek-R1
  • 温度:0.2
  • 输入:图片提取文字 + 风险特征 + 搜索结果
  • 功能:综合所有信息,给出最终风险等级和判定依据
  • 输出final_verdictrisk_level(red/yellow/green)、recommendation
节点 7:结果格式化与决策
  • 模型:Qwen3-32B-Instruct
  • 功能:将技术分析结果转化为老人友好的文字,同时生成结构化决策数据
  • 输出friendly_textstructured_result(含 needs_family_alert
节点 8:家属推送(MCP)
  • 触发条件needs_family_alert == true(即 risk_level == red)
  • 功能:通过支付宝消息推送/短信通知家属
  • 推送内容:风险类型、判定结果、分析摘要、建议
节点 9:历史记录存储(MCP)
  • 功能:将完整识别记录存入数据库
  • 存储字段:用户ID、时间戳、图片URL、地点、内容类型、提取文字、风险等级、判定结果、建议、推送状态

三、端侧/云端插件运用

3.1 端侧插件:gPass 眼镜插件

项目 说明
插件 ID 20260126z7IU06451341
插件来源 蚂蚁集团 GPASS 智能眼镜应用模板
核心能力 眼镜设备拍照采集
输入参数 prompt_message(String):拍照提示语
输出参数 code(String):拍照状态;data(String):图片数据地址
使用方式 在百宝箱工作流中作为 MCP 节点拖入,从条件分支连线接入

关键设计决策:gPass 插件仅负责拍照采集,不包含 OCR 和语义理解。我们选择在后续节点中使用多模态大模型直接处理图片,避免了 OCR 管线的额外开销和信息损失。

3.2 云端插件:夸克搜索

项目 说明
插件类型 MCP 节点
功能 联网搜索权威信源
站点过滤 nhc.gov.cn、people.com.cn、xinhuanet.com、cctv.com、samr.gov.cn
使用目的 交叉验证多模态模型的初步判断,引入权威信源提升可信度

3.3 云端插件:消息推送

项目 说明
插件类型 MCP 节点
功能 高风险时向家属推送预警消息
触发条件 risk_level == red
推送渠道 支付宝消息推送 / 短信通知

3.4 大模型选型

节点 模型 选型理由
图片质量预检 Qwen3.7-plus 多模态能力,低温 0.1 确保稳定判断
多模态分析 Qwen3.7-plus 核心识图能力,直接处理图片无需 OCR
综合判定 Qwen3.7-plus 深度推理能力,综合多方信息给出最终判定
结果格式化 Qwen3.7-plus 文本生成能力强,适合生成老人友好文案

四、技术方案说明

4.1 为什么不用知识库?

传统方案需要预先构建谣言库、假保健品库,存在三大问题:

  1. 覆盖率有限:新谣言层出不穷,知识库无法实时更新
  2. 维护成本高:需要人工标注、定期更新
  3. 泛化能力弱:只能识别库里已有的内容

本方案用多模态大模型直接看图分析 + 联网搜索实时验证,实现了零知识库依赖的动态识别,覆盖面更广、时效性更强。

4.2 多模态直接识图 vs OCR 管线

方案 流程 优缺点
OCR 管线 拍照 → OCR提取文字 → 大模型分析文字 文字提取准确,但丢失图片布局信息,多一个节点
多模态直接识图(本方案) 拍照 → 多模态模型直接看图 一步完成,保留图片上下文,能识别包装标志等非文字信息

4.3 风险等级体系

等级 含义 触发条件 响应动作
RED 高风险 明确骗局/违规宣传/已知谣言 推送家属 + 强烈建议不要购买
YELLOW 中风险 可疑内容/无法完全确认 提醒谨慎,建议咨询医生/子女
GREEN 低风险 资质合规/真实信息 正常提示,提醒保健品不能治病

4.4 输出示例

假新闻场景:

{
  "friendly_text": "这条消息是谣言。国家卫健委早就澄清过,洋葱不能杀死癌细胞。生病要看医生,不要相信偏方。",
  "risk_level": "yellow",
  "verdict": "rumor",
  "recommendation": "不要转发,如有身体不适请咨询医生"
}

假保健品场景:

{
  "friendly_text": "红色警告!这个产品有问题!它宣称能根治糖尿病,这是违规宣传。保健品不能替代药品。请马上离开,不要购买。请告诉您的家人。",
  "risk_level": "red",
  "verdict": "scam",
  "recommendation": "不要购买,立即离开,告知家人"
}

五、GPASS 端侧配置

端能力 配置
语音唤醒 关键词触发工作流入口
镜腿双击 切换功能模式
镜腿长按3秒 紧急联系人
拍照 自动对焦,延迟2秒,提示语播放
语音播报 眼镜扬声器,音量80%
震动 高风险震动提醒

六、项目优势总结

  1. 零门槛:老年人戴上眼镜即可使用,无需任何手机操作
  2. 全场景覆盖:假新闻、假保健品、虚假宣传一键识别
  3. 高可信度:多模态模型 + 联网搜索双重验证
  4. 防护闭环:识别 → 验证 → 预警 → 家属告警,全链路覆盖
  5. 无知识库依赖:动态识别,不受预置数据限制
  6. 可扩展性:工作流节点可灵活增减,支持后续接入更多场景

七、开发环境与工具

项目 说明
开发平台 蚂蚁百宝箱(tbox.alipay.com)
眼镜设备 乐奇 AI 眼镜(GPASS 智能眼镜应用模板)
核心插件 gPass 眼镜插件(ID: 20260126z7IU06451341)
多模态模型 Qwen3.7-plus
推理模型 Qwen3.7-plus
文本模型 Qwen3.7-plus
搜索引擎 夸克搜索(MCP)
消息推送 支付宝消息推送 / 短信通知
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐