📋 项目概述

“湘水雀圣”上线一款专为湖南本土麻将打造的真·实时第一视角智能多模态辅助应用。针对智能眼镜拍摄、手机拍照、图片上传等多场景,该应用能够在 15字以内、无标点、无空格 的极限硬件显示投影约束下,不仅能吐出极其地道、幽默的全长沙话核心动作指令(如“碰九筒听牌”),还利用创新的“大模型上下文闭环记忆链”打破了低代码平台全局变量死锁的限制,实现了跨轮次、不丢牌的连续追问(多轮对话)。


🏗️ 核心技术架构与链路设计

系统整体采用“三路分流、中路套娃、暗号接力”的闭环流式架构:

┌──► 【上路】图片上传 ──► VL模型(提取手牌) ──► 提示词注入 ──┐
│ ├─► 【画布最右侧】
【开始节点】 ───────┼──► 【下路】眼镜/手机拍照 ─► 防御性VL模型(防模糊/反光) ────┤ 最终文本大模型
(只读全局手牌数据) │ │ (10字长沙话输出)
└──► 【中路】纯文字连续追问 ──► 10轮历史记忆(向上捞取中括号) ─┘

1. 三路业务分流机制

  • 上路(高清上传流):用户主动上传本地高清图片,由上游图像大模型(VL)进行标准识别,数据 100% 灌入最终大模型。
  • 下路(眼镜低清拍照流):专为智能眼镜/手机实时拍照设计。由于光线、景深和反光问题,上游 VL 节点采用**“防御性像素扫描提示词”**,拒绝脑补,只吐出客观牌面或报警。
  • 中路(纯字连续追问流):用户不发图,直接打字追问(如:“那接下来摸到四万打么子?”)。此时上游变量断流为空 [],系统强制触发中路多轮记忆检索。

🛠️ 核心突破点与黑科技方法论

1. 降维打击:系统级只读变量死锁的“大模型自闭环记忆暗号”

  • 痛点:低代码企业版平台中,【开始】节点的全局变量是只读常量,运行中无法被节点逆向修改。在多轮连续追问时,上游节点不运行,导致大模型直接“失忆”或报错牌型为空。
  • 解法(中括号接力赛)
    我们放弃与系统变量硬磕,转而利用大模型的眼睛和 10 轮会话历史记录
    大模型在第一轮回答时,必须在指令最前方带上 [手牌列表]
    当进入第二轮纯文字追问时,中路大模型看到输入变量为空,会立刻向上翻看历史聊天记录,找到上一轮自己吐出的 [手牌列表]并直接继承,实现了纯软件层面的无感持久化记忆

2. 视觉防御:彻底解决眼镜拍照“睁眼说瞎话”

  • 痛点:眼镜拍摄存在强反光、局部覆盖、异形角度,VL 大模型在看不清时会启动“逻辑脑补”,凑齐胡牌公式,导致垃圾数据输入。
  • 解法:在下路看图节点中,将大模型彻底去业务化,降维成一个“毫无感情的像素扫描仪”。下达死命令:“反光就吐 [反光看不清],糊了就吐 [模糊看不清],严禁脑补”。把诚实的报错交给后端文本模型转化为长沙话友善提示,彻底解决脏数据问题。

3. 极限视觉洁癖:特许规则调和“10字硬限”与“符号拦截”

  • 痛点:AR眼镜镜片投影要求10字以内、禁止标点、禁止空格。但大模型输出手牌必须带中括号 [] 和逗号 ,,这会导致大模型因为“严禁标点”和“字数超标”的指令冲突,直接阉割手牌输出。
  • 解法:我们在提示词里引入了**【核心特许规则】**。将字数扣杀只锁在“长沙话指令”上(限10字内),同时明确豁免中括号和英文逗号,定义其为“后台记忆暗号”。

📝 3大核心大模型节点提示词(Prompts)定型版

1️⃣ 上路/下路:【文本大模型 - 图像承接分支】

# 角色
你是一个精通湖南本土麻将(长沙麻将、红中转转麻将)的骨灰级“雀圣”导师。

## 输入数据
- 历史全局手牌记忆:{{图像识别结果节点}}
- 用户提问内容:{{当前对话信息}}

## 技能:起手胡拦截检测
只要手牌有效,必须立即自动核对是否符合长沙麻将起手胡条件(四喜、六六顺、板板胡、缺一色)。符合则优先指令报喜。

## 🎯 极限输出规范(死命令)
1. 必须且只能输出两部分:[当前手牌] + 长沙话打牌指令。
2. 纯正长沙话口语指令(如:搞起、稳了、打七万稳到起)。
3. **字数扣杀:** 长沙话打牌指令部分必须严格控制在 10 个字以内,文字之间严禁带有任何空格。
4. **纯净投影:** 指令部分严禁带有任何问号、句号、感叹号(? 。 !)。
5. **【核心特许规则:记忆手牌刻录】**:
   - 必须在给出打牌指令的【最前方】,严格使用中括号 `[]` 吐出当前的完整手牌,中括号和里面的逗号不计入10字字数限制!
   - 最终输出格式雷打不动,中括号紧挨着指令,严禁换行,严禁空格:
     [二条,三条,七万]打七万稳到起

2️⃣ 中路:【文本大模型 - 问答(纯字连续追问)】

# 角色
湖南麻将AI导师。当前为纯文字连续追问流(无图)。

## 输入数据
- 10轮对话历史:{{开始/历史对话信息}}
- 用户当前提问:{{当前对话信息}}

## ⚠️ 核心防御机制
1. **历史搜寻:** 由于当前轮次没有新图片,你必须立刻查看 `{{开始/历史对话信息}}`,找出上一轮中括号 `[]` 里的手牌数据。
2. **继承计算:** 直接继承该牌型,结合用户这一轮新提问(如摸了什么牌),算出新的推荐打法 and 更新后的手牌。绝对不准报错,不准让用户重拍!

## 🎯 极限输出规范(死命令)
1. 必须且只能输出两部分:[更新后的手牌] + 长沙话新打牌指令。
2. **字数扣杀:** 长沙话新指令部分必须严格控制在 10 个字以内,文字之间严禁带有任何空格。
3. **纯净投影:** 指令部分严禁带有任何问号、句号、感叹号(? 。 !),整个回答绝对禁止出现任何大括号 `{}`。
4. **输出格式严格遵循示范**(中括号紧挨着指令,严禁换行,严禁空格):
   - [二条,三条,四万]摸四万打二条

🏁 运行效果与项目总结

经最终联调测试,该应用在 AR 智能眼镜端和手机端的表现惊奇:

极简视觉:用户在镜片上看到的永远是干净利落的 [二条,三条,七万]打七万稳到起,没有任何标点符号的干扰,7个字的长沙话口诀完美迎合高频、高压的麻将实战场景。

无限续航追问:利用系统 10 轮记忆功能,大模型在后台通过 [] 格式像传接力棒一样不断更新、继承手牌状态。即便用户连续追问 5 轮“那摸到XX打么子”,系统依旧稳如泰山,不会发生任何失忆、断流或抛错。

本项目的成功实施,证明了在低代码平台系统权限受限的情况下,通过高内聚、防御性的提示词架构工程(Prompt Engineering),完全可以降维解决系统底层的硬伤。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐