登录社区云,与社区用户共同成长
邀请您加入社区
做 AI 应用开发时,我们经常需要处理大模型的输出文本。大模型生成自然流畅的人类语言能力很强,但要把这些非结构化的自然语言,精准转换成能直接存入数据库、能安全传给下游接口的标准 JSON 格式,却是一件非常棘手的事情。好在 LangChain 为这个行业普遍存在的痛点提供了优雅的解决方案 —— 通过它内置的专业输出解析器,只需寥寥几行代码,就能轻松实现从自然语言到结构化 JSON 的可靠转换。
当NVIDIA显卡价格居高不下时,许多开发者开始将目光转向AMD显卡的ROCm生态。本文将手把手带你完成RX 5700XT在Ubuntu 22.04上的完整深度学习环境配置,从驱动安装到PyTorch验证,彻底告别CUDA依赖。与WSL2方案相比,原生Ubuntu系统能提供更直接的硬件访问和更稳定的ROCm支持。对于预算有限的研究者,这套配置提供了极具性价比的选择。ROCm生态下的PyTorch安
结论:基础预训练不自带工具调用 / JSON Schema 能力;商用模型(如 GPT-4o)是做过专项训练;开源模型可通过微调补上;推理时还可配合约束解码强保格式。下面分训练、推理、工程落地三部分讲清楚。普通预训练(Next Token Prediction)只学文本续写,不懂工具调用协议,也不懂 JSON Schema 规范。GPT-3.5/4/4o 的Tools+JSON Schema 能力
json"description": "获取城市天气","parameters": { /* JSON Schema 对象 */ }生产环境必须开启,强制模型 100% 符合 Schema。
终结 JSON 解析崩溃:用 Coze 工作流做中间层,平台级多重验证 + 自动修复,实现零失败结构化输出
摘要 YAML和JSON都能描述树形数据,但优化目标不同:JSON侧重机器交换,YAML侧重人类编辑。在大模型和Agent场景中,配置文件常需包含模型参数、工具列表、工作流节点和多行prompt,这正是YAML的优势所在。 YAML核心语法简单,常用功能包括对象、数组、字符串、多行字符串和注释。但需注意缩进、引号和多行文本等易错点。JSON字符串必须用双引号,而YAML更宽松,但类型判断可能产生歧
带标注的光伏太阳能板异常数据集,识别率90.5%,9817张图,支持yolo,coco json,voc xml,文末有模型训练代码。
线上跑得好好的 LLM 接口,为什么时不时就把 JSON 弄崩?本文从"自然语言承诺不等于工程契约"出发,深度解析只靠 Prompt 写"请返回 JSON"会踩的五类翻车点,对比 JSON Mode、Structured Outputs、Function Calling 三大结构化支柱的本质差异,并讲清楚一个关键认知:Function Calling 并不代表模型执行了代码
带标注的PCB电路板缺陷数据集,识别率99.2%,可识别6种缺陷,9961张图,支持yolo,coco json,voc xml,文末有模型训练代码。
带标注的发霉变质面包数据集,识别率79.1%,924张图,支持yolo,coco json,voc xml,文末有模型训练代码。
带标注的药品好坏数据集,识别率99.2%数据集,可识别药品的良品次品和空缺,1124张图,支持yolo,coco json,voc xml,文末有模型训练代码。
本文介绍了一个高精度带标注的打电话图像数据集,包含9315张图片,识别率达99.5%,支持YOLO、COCO JSON和VOC XML格式。数据集分为训练集(8323张)、验证集(502张)和测试集(490张),经过自动定向和640x640拉伸预处理。特别指出模糊图片是刻意设计的数据增强策略,可提升模型在真实场景中的鲁棒性。提供了YOLO模型训练代码及验证测试脚本,支持目标检测结果的坐标提取和可视
带标注的路上井盖识别数据集,可识别无盖,遗失,破损,完好,圆形井盖,识别率85.1%,3422张图,支持yolo,coco json,voc xml,文末有模型训练代码。
带标注的骑电动车是否佩戴头盔数据集,识别率77.1%,1345张图,支持yolo,coco json,voc xml,文末有模型训练代码。
大模型 JSON 输出异常,本质是模型幻觉与业务确定性需求的矛盾。通过「事前引导→事中约束→事后补救」的全链路解决方案,可实现 JSON 输出稳定合规,适配不同场景、不同类型大模型。事前引导:通过明确字段规则、提供 Few-Shot 示例、添加校验指令,低成本引导模型输出合规 JSON;事中约束:借助JSON Mode,实现硬约束,从源头杜绝异常;
如何让大模型稳定输出JSON
本文介绍了一个装修平面图元素识别数据集,包含303张标注图片,支持识别入口、床、门、窗等8类元素,识别率达93.9%。数据集提供YOLO、COCO JSON和VOC XML格式,包含模型训练代码和验证测试脚本。数据预处理包括图像拉伸至640x640,未使用数据增强。特别指出模糊图片是增强模型鲁棒性的设计策略,可提升在复杂场景下的识别能力。文末提供了模型训练指标和效果图,并附数据集下载链接和YOLO
。
带标注的加工件焊缝缺陷数据集,可识别焊缝,缺陷,工件,识别率96%,1011张图,支持yolo,coco json,voc xml,文末有模型训练代码。
车轮胎螺母识别数据集是一个包含83张高质量标注图片的目标检测数据集,涵盖不同角度、光照和背景条件。数据集支持YOLO、COCO和Pascal VOC格式,兼容主流检测框架。基于该数据集训练的模型实现了87.2%的识别率和45 FPS的推理速度(RTX 3060)。数据集按59:16:8划分训练/验证/测试集,提供详细标注(类别为"Screw")。配套提供YOLO模型训练教程,包括环境配置、数据准备
打电话识别数据集摘要 该数据集包含9723张高质量标注图片,专用于打电话行为识别,在YOLO系列模型上测试识别率达98.9%。核心特点包括: 多格式支持:提供YOLO、COCO JSON、PASCAL VOC XML三种主流标注格式; 真实场景覆盖:涵盖多种光照、角度及模糊条件,增强模型鲁棒性; 数据增强:含水平翻转、曝光调节等预处理,模糊图片设计提升泛化能力。 数据集按8508/811/404划
本数据集包含9,709张标注图像,涵盖菊花、人参、灵芝等99种常见中药材,支持YOLO、COCO JSON和VOC XML格式。数据集分为训练集(9,204张)和测试集(505张),图像经预处理调整为640x640分辨率。每种药材均提供拉丁名、中文标准名和英文名对照表。该资源可用于中药材自动识别模型的开发,文末附有模型训练代码,为中医药数字化研究提供基础数据支持。
GEO行业长期缺乏统一、可量化的效果验收标准,企业完成服务交付后难以独立判断优化效果的真实性。香港品牌研究院《GEO行业发展标准体系白皮书V2.0》第02卷《生态篇》构建了完整的GEO效果验收体系,涵盖八大核心验收指标、标准化计算公式、合格线定义及三重防造假核验机制,为行业提供了可量化、可追溯、可独立复核的验收标尺。本文从技术视角解读验收体系的核心内容与实施路径,适合技术决策者、数字化从业者阅读参
摘要: 本数据集包含21种常见中药材(如天麻、甘草、当归等)的2237张高质量标注图片,支持YOLO、COCO JSON和Pascal VOC XML三种标注格式,适用于中药材自动识别、智能药房管理等场景。数据集分为训练集(71.3%)、验证集(18.6%)和测试集(10.1%),经预处理统一为640×640像素。基于YOLOv8训练的模型平均精度(mAP@0.5)达73.8%,推理速度约15ms
文章摘要:大模型输出JSON不完整是一个常见的工程稳定性问题,表现为语法不完整或内容缺失。原因包括输出长度限制、输入上下文过长、Schema设计复杂等。解决方案需从多层面治理:优先使用结构化输出能力,避免一次性生成大JSON,建立JSON修复机制,设计Schema校验,实施业务完整性检查,并引入重试补偿机制。核心思路是将模型输出视为候选结果,通过工程化流程确保最终JSON的完整性和准确性,而非单纯
本文介绍了一个高质量的山体滑坡检测数据集,包含974张标注图像,识别率达78.1%,支持YOLO、COCO和Pascal VOC格式。数据集按标准分为训练集(89.3%)、验证集(7.9%)和测试集(2.8%),并经过自动定向和尺寸统一预处理。数据集中模糊图像被设计为增强模型鲁棒性的策略,能提升复杂场景下的识别能力。文中提供了YOLO模型训练代码及验证示例,帮助用户快速应用于滑坡检测和地质灾害监测
是一个高质量的开源数据集,包含7000张带标注的遥感图像,专门用于船舶目标检测任务。该数据集在测试集上达到了**92.9%**的识别率,支持YOLO系列(v7-v12、v26)、COCO JSON和PASCAL VOC XML等多种标注格式。文末附有完整的模型训练代码,方便快速上手。
本文介绍了一个包含15,645张标注图像的饮料瓶罐分类数据集,涵盖塑料瓶、玻璃杯、易拉罐等9类常见容器。数据集提供YOLO、COCO和Pascal VOC三种标注格式,测试准确率达95%。文章展示了模型训练指标(mAP50达0.95)和损失曲线,并说明数据集中模糊图片可增强模型鲁棒性。提供了完整的数据集下载链接(CSDN)和YOLO训练代码(GitCode),附带验证测试脚本。该数据集支持1024
带标注的棉花数据集,可识别未开裂,开裂,初花,受精花,成熟的等5种棉花生长阶段数据集,识别率76.5%,1388张图,支持yolo,coco json,voc xml,文末有模型训练代码。
摘要:该数据集包含8080张标注蜜蜂图像,支持YOLO、COCO JSON和VOC XML格式,识别率达88.6%。数据集分为训练集(5640张)、验证集(1604张)和测试集(836张),图片预处理为640x640拉伸尺寸。提供YOLO模型训练代码和验证测试脚本,包含模糊图片以增强模型鲁棒性。数据标注示例和训练指标参数已展示,可通过链接下载完整数据集。
本文介绍了一个用于识别路面坑洼(pothole)和减速带(speed-bump)的数据集,包含5735张标注图片,支持YOLO、COCO JSON和VOC XML格式。数据集划分为训练集(5319张)、验证集(314张)和测试集(102张),图片预处理为640x640分辨率。作者提供了YOLO模型训练代码,并分析了模糊图片在增强模型鲁棒性、模拟真实噪声和防止过拟合方面的优势。文末还展示了模型验证测
把大模型当做纯粹的黑盒,让它直接吐出文本去怼后端的解析层,是系统设计上最脆弱的一环。日常的业务代码是确定性的,但 AI 业务很多开发最大的痛苦,就是总是试图用传统的“输入-输出”思维,去驾驭一个充满概率性的大模型。
本文介绍了一个高精度篮球场景目标检测数据集,包含9515张标注图片,涵盖球、篮框和运动员三类对象,准确率达97.9%。数据集支持YOLO、COCO JSON和VOC XML格式,分为训练集(6662张)、验证集(1893张)和测试集(960张)。预处理包括自动定向和640×640拉伸,未使用数据增强。文中提供了YOLO模型训练代码和验证测试脚本,特别分析了模糊图片在提升模型鲁棒性、模拟真实噪声和防
AI内容创作常见问题不是提示词不够长,而是输入需求没有结构。本文用Python实现JSON Brief编译器,对目标读者、问题、必需事实、禁止表述、输出结构和资料说明进行校验,再生成可审核提示包,让缺失信息在调用模型前暴露。
摘要: 该研究提供了一个包含2110张图像的寄生虫数据集,涵盖8种常见寄生虫类型(如人蛔虫、钩虫属、血吸虫等),支持YOLO、COCO JSON和VOC XML格式,识别率达83.2%。数据集按70%训练集、20%验证集和10%测试集划分,图像预处理为640x640分辨率,无数据增强。文中强调了模糊图像对提升模型鲁棒性和泛化能力的作用,并提供了YOLOv8训练代码及验证脚本。用户可通过下载数据集和
该数据集包含24种标注浮游藻类的23,175张图片,识别率达91.5%,支持YOLO、COCO JSON和VOC XML格式。数据集按训练集(20,271张)、验证集(1,940张)和测试集(964张)划分,图片预处理包括自动定向和调整为640x640分辨率。提供包含中英文对照的24种藻类标签,并附有YOLO模型训练代码和验证测试脚本。数据集中的模糊图片作为数据增强策略,可提升模型在复杂场景下的鲁
提示词工程(Prompt Engineering)是通过优化输入文本来精准引导大模型输出的关键技术,核心目标是实现可控、准确、格式化的结果。本文系统介绍了其核心内容:1)JSON格式作为约束输出的工具,便于程序解析;2)CRISPE框架(角色、背景、指令等)提供结构化设计方法;3)主流技巧如零样本/少样本提示及思维链应用;4)LangChain工具(如PromptTemplate、ChatProm
AI大模型训练数据跨越国界,品牌语义资产天然具有全球流动性,但各国治理规则呈现碎片化状态,全球缺乏一套可操作、可度量、可审计的AI语义治理基准框架——本卷称之为“范式真空”。香港品牌研究院《GEO行业发展标准体系白皮书V2.0》第10卷《全球篇》提出全球语义治理概念,构建三层治理架构(伦理共识层、度量标尺层、服务商执行体系层),明确HKIBR标准体系作为全球可选基准的定位与协同原则。本文从技术治理
上篇我们鸟瞰了.claude(云端同步)和(本机独享)。我们逐行拆解真实配置,把每个字段的含义、最佳实践和常见坑都说清楚。
本文探讨了使用Codex升级项目依赖时可能遇到的问题及解决方案。主要建议包括:不要盲目升级所有依赖,应分批处理;保留Lock文件避免环境差异;明确限制Codex修改范围;升级后必须进行完整回归测试。文章提出了六步流程:先分析依赖关系、分批升级核心依赖、谨慎处理Lock文件、限定修改范围、全面验证、评估升级必要性。强调依赖升级不是简单修改版本号,而是需要系统性的分析和验证过程,Codex可作为辅助工
我有一个执念:让 OpenClaw 里的 Agent 真正用好 Claude Code、Codex 和 Gemini CLI。不是让它在聊天框里吐出 500 行代码,再等人复制粘贴;而是让它调用专业工具、创建文件、运行测试,失败后继续修。为了解决这个问题,我写了 CLI-Switch。先说明版本:这篇复盘的是 2026 年 3 月公开时的 CLI-Switch。后来的 v1.0 已经重构命令和执行
浮点数数组是由一组浮点数构成的数组。浮点数是一种数学类型,它代表了一个实数,即带有小数点的数值。浮点数可以用于表示小数和科学计数法等数学概念。在Python中,浮点数数组可以用NumPy库来表示。NumPy是Python的一个科学计算库。它提供了一个大型的多维数组对象,以及用于处理数组的各种函数。NumPy的主要目的是处理数字图像和数学数据。它非常适合于科学计算和数据分析。在这篇文章中,我们将使用
public class CursorFileManager implements CursorManager{public void write(String key, LongCursor cursor) throws IOException{File file = new File(key);if (cursor == nul...
文件路径:logstash/vendor/bundle/jruby/1.9/gems/logstash-patterns-core-4.1.0/patterns/grok-patterns在线调试grok规则匹配网址:https://grokdebug.herokuapp.com/转载于:https://www.cnblogs.com/zhaojonjon/p/86167...