Java AI - AI基础知识
什么是AI
AI(Artificial Intelligence,人工智能)是指通过计算机系统模拟人类智能的技术,核心是让机器具备原本只有人类才有的感知、思考、决策和行动能力。
核心本质
- 不是 “真正的意识”,而是基于数据和算法的 “智能模拟”。
- 核心目标:让机器自主完成原本需要人类智力参与的任务(如识别、推理、学习、决策)。
关键特点
- 数据驱动:通过大量数据学习规律(比如从百万张图片中学会识别猫和狗)。
- 自主学习:无需人类逐行编程,能通过算法自动优化性能(比如 AI 下棋越下越厉害)。
- 多任务适配:同一套 AI 系统可适配不同场景(比如大模型既能聊天也能写代码、做翻译)。
常见应用场景
- 日常交互:智能语音助手( Siri、小爱同学)、聊天机器人(客服、AI 玩伴)。
- 识别与分析:人脸识别(解锁手机)、图像识别(拍照搜物)、文字识别(扫描转文字)。
- 决策与优化:导航路线规划、电商推荐(猜你喜欢)、金融风险评估。
- 创作与生成:AI 绘画、写文案、生成代码、视频剪辑辅助。
简单分类
- 弱 AI(当前主流):专注单一任务,比如语音转文字、推荐算法,没有通用思考能力。
- 强 AI(理论目标):具备与人类相当的通用智能,能理解、学习任何人类能做的智力任务(目前尚未实现)。
常见应用场景

1. 日常生活领域
- 智能助手:语音助手(Siri、小爱同学)、聊天机器人(微信客服、AI 玩伴)
- 出行导航:高德 / 百度地图路线规划(实时路况优化)、网约车智能派单
- 家居生活:智能家电控制(语音控灯、空调)、安防监控(人脸识别门禁)
- 娱乐消费:短视频推荐(抖音 / 快手)、音乐 / 影视推荐(网易云 / Netflix)、AI 绘画 / AI 修图
2. 工作办公领域
- 内容创作:AI 写文案、生成 PPT、视频脚本、代码辅助(GitHub Copilot)
- 文档处理:OCR 文字识别(扫描转 Word)、PDF 批量处理、文档翻译、智能摘要
- 协作管理:项目进度预测、任务分配优化、智能会议纪要(语音转文字 + 提炼重点)
3. 商业服务领域
- 电商零售:商品推荐(淘宝 “猜你喜欢”)、智能客服、销量预测、库存优化
- 金融服务:风险评估(信贷审批)、 fraud 检测(信用卡盗刷识别)、智能投顾
- 餐饮服务:外卖智能调度、菜品推荐、自助点餐机语音交互
4. 医疗健康领域
- 诊断辅助:医疗影像分析(CT/MRI 病灶检测)、病理切片识别
- 健康管理:智能问诊(初步症状判断)、慢病监测、个性化用药推荐
- 科研辅助:药物研发(分子结构筛选)、疫情数据建模预测
5. 工业制造领域
- 智能生产:设备故障预测(传感器数据分析)、生产流程优化、质量检测(视觉识别瑕疵)
- 供应链:物流路径优化、库存需求预测、供应商风险评估
6. 教育学习领域
- 个性化学习:错题分析、定制学习计划、AI 辅导(答疑解惑)
- 教学辅助:自动批改作业、课件生成、语言口语练习(AI 陪练)
常见概念
模型
AI 模型是基于数据训练、能模拟人类智能完成特定任务的数学算法与数据结构组合。
- 是数据与算法的结合体,通过学习数据中的规律形成 “认知”。
- 不直接存储原始数据,而是保留提炼出的特征与逻辑关系。

模型 = 从经验中学习到的"规律总结"
模型的本质是什么?
核心理解:模型是一个数学函数
// 最简单的模型:y = ax + b
输入 x → 模型处理 → 输出 y
例子:
房价预测:房屋面积(x) → 模型 → 预测价格(y)
垃圾邮件:邮件内容(x) → 模型 → 是/不是垃圾邮件(y)
核心组成部分
-
架构 (Architecture) - 模型的"大脑结构"
就像人类的神经网络
决定:模型能学多复杂、能处理什么类型问题 -
参数 (Parameters) - 模型的"知识"
模型学到的具体规律
比如:什么样的特征代表"猫"
参数越多 = 知识越丰富 -
算法 (Algorithm) - 模型的"学习方法"
如何从数据中学习规律
比如:梯度下降、反向传播
模型的分类
按学习方式分

- 监督学习模型 - 有标准答案,例如
学生:做有答案的习题册
例子:分类模型、回归模型 - 无监督学习模型 - 自己找规律,例如
学生:观察数据自己总结模式
例子:聚类模型、降维模型 - 强化学习模型 - 通过奖励学习,例如
学生:打游戏,赢了加分输了扣分
例子:游戏AI、机器人控制
按应用领域分

- 语言模型 - 处理文字,如ChatGPT、翻译软件
- 视觉模型 - 处理图像,如人脸识别、自动驾驶
- 语音模型 - 处理声音,如语音助手、语音转文字
- 推荐模型 - 猜你喜欢,如淘宝推荐、抖音推荐
模型的生命周期

1.训练阶段 - 学习知识
输入:大量数据 + 正确答案
过程:调整参数,让预测更准确
输出:训练好的模型
2.验证阶段 - 检查学习效果
输入:新的测试数据
目的:检查模型是否真的学会了
避免:死记硬背(过拟合)
过拟合:模型过度贴合训练数据,无法泛化到新数据
3.推理阶段 - 实际应用
输入:真实世界的问题
输出:预测结果或决策
例子:用户输入问题 → 模型 → 回答
大语言模型
大语言模型(Large Language Model,简称 LLM)是一种由包含数百亿以上参数的深度神经网络构建的语言模型,通常使用自监督学习方法通过大量无标注文本进行训练,它能够预测、生成自然语言文本并理解语言文本的含义。
发展历程
大语言模型的发展可以追溯到 20 世纪 50 年代的神经网络和神经信息处理系统实验。20 世纪 70 年代,N-gram 语言模型成为常用的统计语言模型之一。1997 年,长短期记忆(LSTM)网络出现。2017 年,Google 发布论文提出 Transformer 架构。2018 年,Google 和 OpenAI 分别提出了 BERT-1 和 GPT-1 模型,开启了预训练语言模型时代。2020 年,OpenAI 发布了参数量达 1750 亿的 GPT-3。2022 年 11 月 ChatGPT 发布,引起广泛关注。2024 年 3 月,马斯克的 xAI 公司发布了参数量达到 3140 亿的 Grok-1,这是当时参数量最大的开源大语言模型。
架构特点
绝大部分大语言模型都是基于 Transformer 架构,该架构具有独特的注意力机制,自注意力机制允许模型根据序列中的其他位置调整每个位置的表示,从而提高模型对上下文的理解能力,相比传统的循环神经网络(RNN)和长短时记忆网络(LSTM)具有明显优势。
构建流程
首先是预训练,需要收集海量无标注数据,如互联网上的文本、新闻等,经过清理、分词等处理后以 tokenizer 粒度输入到语言模型中,让模型学习词汇、句法和语义的规律以及上下文的关系。预训练完成后,可通过指令微调,将大量各类型任务统一为生成式自然语言理解框架,并构造训练语料进行微调,以提升模型在特定任务上的性能。
特点及能力
大语言模型具有大规模参数,能够学习丰富的语言特征和模式;具备预训练能力,可在大量文本数据上进行预训练,学习语言的通用表示,从而泛化到多种不同任务;具有微调灵活性,可以在特定任务的数据集上进行微调,适应不同的应用场景;还能够理解输入文本的上下文,生成连贯和相关的输出,并且一些大模型能够处理多种语言任务,展现出一定的通用性。
常见语言大模型
-
GPT 系列:由 OpenAI 开发,是生成式预训练语言模型的成功典范,基于 Transformer 架构,采用自回归生成模型。从 GPT-1 到 GPT-4,其性能不断提升,应用场景广泛,包括文本生成、编程辅助、创意写作等,但存在计算资源消耗大、推理时可控性差等问题。
-
百度文心大模型:包含 NLP、CV 和跨模态大模型。文心 ERNIE 系列模型具有强大的小样本学习能力和基本推理能力,文心 ERNIE-ViLG 2.0 能够生成语义相关、质量更高的图片。该模型在多任务学习和泛化能力上表现出色,适合智能客服、内容推荐、图像识别等场景。
-
阿里云通义千问:阿里达摩院推出的大模型,拥有千亿参数,具备多轮对话、文案创作、逻辑推理、多模态理解、多语言支持等核心能力。其灵活性和适应性强大,支持长文本输入,性价比高,适用于金融、医疗、教育、物流等多个行业。
-
科大讯飞星火大模型:支持对话、写作、编程等功能,还能提供语音交互方式,具备跨语言、跨领域的知识理解和推理能力。该模型技术先进,审核速度快,代码解释能力强,适合知识学习与内容创作、科研任务、数学问题解决、代码生成与调试等场景。
-
字节跳动豆包大模型:是字节跳动开发的大语言模型,支持视频脚本撰写、文案生成、营销策划等,具备聊天机器人、写作助手、英语学习助手等功能。其价格极低,在知识问答、文本生成、语言翻译、逻辑推理、对话交流等场景表现出色。
-
华为云盘古大模型:在多模态数据处理方面表现出色,能够处理图像、文本等多种数据类型,可应用于智能监控、内容审核等场景。
-
360 安全大模型:专注于网络安全领域,由攻击检测、运营处置、追踪溯源、知识管理、数据保护、代码安全等六大专家子模型组成,可提供安全防护和威胁检测等功能,适用于企业网络安全、个人隐私保护等场景。
-
DeepSeek:采用混合专家模型(MoE)架构和多头潜在注意力机制(MLA),并运用多 tokens 预测(MTP)技术和低精度训练等高效训练技术。具备处理文本、图像、音频等多种数据类型的能力,可应用于自然语言处理、多模态任务、代码生成与调试、金融、教育、娱乐购物、智能制造等场景。
Token

是模型处理文本时的最小语义单元,也叫 “词元”,是模型理解和生成文本的基础单位。
核心特点
- 不是固定的 “字” 或 “词”,而是模型通过分词规则拆分的最小单元。
- 可能是单个字符、半个词、完整词,甚至标点符号、空格,具体取决于模型的分词器(如 GPT 用的 BytePair Encoding)。
常见拆分示例
- 英文:“unhappiness” 可能拆分为 [un, happy, ness],“hello!” 拆分为 [hello, !]。
- 中文:“人工智能” 可能拆分为 [人工,智能] 或 [人,工,智,能],“我爱编程” 拆分为 [我,爱,编,程]。
- 混合文本:“AI 真有趣!” 拆分为 [AI, 真,有,趣,!]。
关键作用
- 是模型计算 “上下文长度” 的单位,比如模型标注 “支持 4096 Token”,即单次可处理约 3000-4000 个中文字符(1 个中文字符约对应 1.2-1.5 个 Token)。
- 模型训练、推理时,会将 Token 映射为数字编码(嵌入向量),再进行语义计算,最终生成的文本也会通过 Token 解码得到。
温度 (Temperature)
是控制生成文本随机性与创造性的核心参数,数值越高输出越灵活多样,越低则越确定、保守。
核心作用
- 本质是调节模型采样概率:低温时,模型优先选择概率最高的词;高温时,会放大低概率词的选中概率。
- 直接影响输出风格:是 “按规矩作答” 还是 “自由发挥” 的关键开关。
数值范围与效果
- 低温(0–0.3):输出高度确定、精准,重复率可能较高。
适合场景:事实问答、代码生成、专业文档撰写等需要准确的场景。 - 中温(0.4–0.7):平衡准确性与创造性,输出自然流畅。
适合场景:日常对话、文案创作、邮件撰写等多数通用场景。 - 高温(0.8–1.0):输出随机性强,充满创意但可能偏离主题、逻辑跳跃。
适合场景:诗歌创作、脑洞故事、营销创意发散等需要突破常规的场景。
关键注意点
- 数值并非越高越好,过高可能导致输出无意义、逻辑混乱。
- 不同模型的 Temperature 基准略有差异,但核心逻辑一致。
- 搭配 Top-P(核采样)使用,可更精准控制输出质量(如低温 + 低 Top-P = 极致精准)。

智能体 (Agent)
简单说,智能体(Agent)就是一个 “有自主能力的 AI 小助手”,不用你一步步指挥,能自己搞定复杂任务。
核心特点
- 自己能 “想事儿”:接到目标后,会自动拆解步骤(比如 “订机票 + 订酒店 + 做行程”,它会分步骤执行)。
- 会用工具:能调用搜索、日历、翻译、文档处理等工具,解决自己搞不定的问题。
- 能适应变化:比如订机票时遇到航班取消,会自动重新查替代航班,不用你再提醒。
- 闭环做事:从理解需求、规划步骤、执行操作,到根据结果调整,全程自己完成。
举个实际例子
你跟它说 “帮我安排下周去上海的 3 天出差,预算 5000 元,要靠近虹桥机场,顺便约见客户 A 和 B”,它会:
- 先查下周往返上海的机票(对比价格、时间);
- 找虹桥机场附近符合预算的酒店;
- 结合客户地址规划每天的行程(避免跑冤枉路);
- 给客户发邀约消息,确认时间;
- 把机票、酒店、行程整理成文档发给你。
全程不用你逐一步骤指挥,它自己就能协调好所有事,像个有经验的真人助理。
hallucinations (幻觉)

什么是幻觉
AI 中的 Hallucinations(幻觉),简单说就是 AI “一本正经地说胡话”, 编造不存在的事实、数据、逻辑或引用,却表现得像真实信息一样。
核心特点
- 内容完全虚构:可能是不存在的人名、地名、文献、数据,或是不符合常识的逻辑。
- 表达极具迷惑性:AI 会用流畅的语言组织这些虚假信息,甚至搭配 “据研究表明”“数据显示” 等表述,让人难辨真假。
- 与事实脱节:即便用户指出错误,部分模型也可能坚持虚假结论,或给出自相矛盾的解释。
常见表现形式
- 编造具体细节:比如 “2024 年某报告显示,90% 的人每天用 AI 办公”(无此报告及数据)。
- 虚构引用来源:声称 “爱因斯坦曾说过 XX”“某学术期刊发表过 XX 研究”(实际并无相关内容)。
- 捏造逻辑关联:比如 “经常喝奶茶能提高记忆力”(无科学依据的虚假因果)。
- 伪造专业内容:如代码、公式、法律条文等,看似规范却无法实际使用或不符合规定。
产生的主要原因
- 训练数据局限:模型对训练数据外的信息不了解,却试图 “强行作答”。
- 逻辑推理缺陷:复杂问题中无法准确串联信息,导致推理链条断裂,进而编造内容补全。
- 追求表达流畅:优先保证语言通顺,却忽略内容的真实性。
- 对模糊问题的 “过度解读”:用户需求不明确时,模型可能凭空生成细节来满足需求。
怎么避免幻觉
以下是几个避免 AI 产生幻觉的实用技巧,覆盖提问、核验、工具搭配等关键环节,简单易操作:
优化提问方式,从源头减少幻觉
- 明确要求 “基于事实作答”,不确定时说明:提问结尾加 “若没有确切信息,直接告知‘无相关准确数据’,不要编造”。
- 限定信息来源:比如 “仅依据 2025 年官方发布的政策回答”“引用知网核心期刊的研究结论”。
- 拒绝模糊提问:不说 “介绍某行业趋势”,而说 “列出 2025 年某行业 3 个已落地的政策及影响,需标注政策来源”。

AI 提供 “依据”,方便核验
- 让 AI 标注信息来源:比如 “回答时注明数据来自哪份报告、哪个官网,或哪篇文献(含作者、年份)”。
- 索要推理过程:复杂问题(如数学题、逻辑分析)要求 “分步骤说明推导过程,每个步骤对应具体依据”。
- 拒绝 “笼统表述”:要求 AI“避免使用‘据研究表明’‘专家认为’等模糊表述,必须明确具体主体”。

搭配工具或方法,交叉验证
- 用 RAG 技术对接权威知识库:让 AI 先检索指定的官方文档、权威数据库,再基于检索结果作答(适合企业、专业场景)。
- 关键信息交叉核验:对 AI 给出的重要数据、结论,用搜索引擎、官方平台或专业工具二次确认(比如财务数据查证监会官网,政策查政府平台)。
- 控制输出的 “创造性”:事实类问题将 Temperature 参数设为 0–0.3,降低 AI 自由发挥的空间,优先选择高概率的准确信息。

及时纠错,引导 AI 修正
- 发现虚假信息直接指出:比如 “你提到的 XX 数据不存在,请重新基于真实信息回答,若没有则说明”。
- 拆分复杂问题:对涉及多领域、多细节的问题,分步骤提问(比如先问 “某政策的发布时间”,再问 “具体条款”),减少 AI 一次性处理的压力。

更多推荐




所有评论(0)