登录社区云,与社区用户共同成长
邀请您加入社区
牧马人本地推理引擎API使用指南,通过Python代理和HTML界面实现本地模型自动化工作流。核心步骤:1)硬件配置建议(显存要求);2)开启局域网访问并启动对话/生图模型;3)运行代理服务器脚本并配置网络类型;4)使用HTML界面生成分镜脚本并批量生图,支持手机端操作。该方案提供从文本到视觉素材的完整本地闭环,无需云端,保障隐私和低延迟。适用于ComfyUI等后续工作流处理,支持多设备协作。注:
大模型注意力机制正经历快速迭代。2022年Flash Attention通过工程优化解决内存瓶颈;2023年聚焦KV Cache优化,出现GQA等技术;2024年分化为KV压缩(如MLA)和架构革新(如Mamba)两条路线。未来趋势包括:动态混合注意力模式、注意力与记忆系统融合、硬件协同设计,以及跨模态统一注意力机制。注意力机制正从固定计算范式演变为自适应信息处理框架,核心目标始终是高效捕捉关键信
摘要: 深度学习开源知识库DeepBase为初学者提供系统化学习路径,整合Python/PyTorch基础、神经网络理论、CV/NLP核心技术及LLM前沿内容。该项目源于作者自学时遭遇的资料碎片化问题,现以完全开源形式分享,包含从张量操作到Transformer架构的完整知识体系,特别适合零基础入门者构建连贯认知。站点涵盖四大模块:工具栈(Python/PyTorch)、深度学习原理、CV/NLP
这一阶段评价的不是模型本身,而是数据与任务的质量:如果前期数据杂乱,任务边界不清,后续训出的模型跑分再高也不可信。数据质量:去重、去污染;标注一致性(常用一致率或 Cohen κ);垂直域的数据集(法律、医学等)往往没有现成试卷,要先定义合格的题目样本。任务定义:输出是离散类别、固定参考答案文本,还是开放生成?与后续评测的衔接:避免训练、公开榜、业务验收各说各话。对绝大多数普通用户, deepse
【代码】【求助】Chatglm cpu 本地部署出错。
glm-4 联网搜索api测试
Dify 之前有介绍过。
在微调qwen-vl的时候,微调完成之后,模型也保存好了,但是用保存的模型进行推理的时候报错,看样子是找不到分词器tokenizer。
llama.cpp是一个大模型推理平台,可以运行gguf格式的量化模型,并使用C++加速模型推理,使模型可以运行在小显存的gpu上,甚至可以直接纯cpu推理,token数量也可以达到四五十每秒(8核16线程,使用qwen2.5-1.5b模型),另外,该平台几乎兼容所有主流模型。本文介绍了如何使用docker部署llama.cpp和llama.cpp的python绑定llama-cpp-python
前不久,Meta前脚发布完开源大语言模型LLaMA,随后就被网友“泄漏”,直接放了一个磁力链接下载链接。然而那些手头没有顶级显卡的朋友们,就只能看看而已了但是 Georgi Gerganov 开源了一个项目llama.cpp次项目的牛逼之处就是没有GPU也能跑LLaMA模型大大降低的使用成本,本文就是时间如何在我的 mac m1 pro 上面跑起来这个模型。
今天,在【NLP学习群】中,一位同学一下问了2个问题,相信大家在微调时也会遇到这样的问题,自己问题应该放在instruction、input、output哪个字段,用什么格式去训练呢?还有同学是几年前的老爷机/笔记本,或者希望大幅提升部署/微调模型的速度,我们应用了动态技术框架,大幅提升其运算效率(约40%),节省显存资源(最低无显卡2g内存也能提升),工众后台:“加速框架”;如果你还不知道该怎么
保姆级本地部署,金牌讲师级工具调用--基于全球10B以下最强LLM模型ChatGLM3-6B
这个问题尝试了很久,实际上是环境的问题,如果在训练过程中,将fp16设置为true+int8量化,那么是可以正常训练推理的,如果不设置int8量化就会报错。可以尝试改变peft的版本。
除英语和中文外,还接受过 27 种语言的数据培训显着提高编码和数学表现;Qwen2-7B-Instruct 和 Qwen2-72B-Instruct 的扩展上下文长度支持高达 128K 令牌更详细的benchmark建议去看官网blog。
Ollama支持在Modelfile中导入GGUF模型:创建一个名为Modelfile的文件, 使用带有要导入的模型的本地文件路径的“FROM”指令。在 Ollama 里创建模型运行模型从Ollama 库下载的大模型可以用prompt 自定义. 例如, 要自定义llama3创建Modelfile# 将参数设置为1[越高越有创意,越低越连贯]# 设置系统信息SYSTEM """""">>> hiHe
基于milvus的多模态检索,本文包含milvus安装使用、attu 可视化,完整指南启动 Milvus 进行了向量相似度搜索,利用CLIP模型进行多模态检索,附完整代码。
市场洞察:帮助企业了解消费者对其产品、品牌及竞争对手的看法和态度,及时掌握市场动态,为产品研发、市场营销和品牌建设提供决策依据。政策制定:了解公众对政策的反馈和需求,为政府制定更加科学、合理的政策提供参考,提高政策的针对性和有效性。内容管理:帮助平台更好地管理和规范用户生成的内容,打击不良信息和违规行为,营造健康、积极的网络环境。本项目旨在利用 Spark、Hive 和 Hadoop 等大数据技术
【代码】Qdrant 使用指南。
然而,不管是langchain还是llamaindex提供的文本分割工具,很难直接对非结构化文本进行准确的语义分割,很多原来连续的内容都被分割在不同块中。deepseek完成本次解析后,将deepseek解析生成的结构化md作为already_parsed输入,将下次待解析非结构化的若干页文档作为waiting_parsed输入。这里尝试基于deepseek,将pdf解析后的非结构化文本转化为结构
ollama部署大模型,ollama,gte-Qwen2-7B-instruct,
输入pip install -i https://pypi.tuna.tsinghua.edu.cn/simple open-webui,使用清华源安装open-webui,,加快下载速度。打开anaconda,输入conda config --add envs_dirs D:\Anaconda\envs指定虚拟环境路径。如果是想直接安装可以双击OllamaSetup.exe,点击Install,
instruction是最新一轮的问,output是最新一轮的回答,history是之前的问和回答。将训练得到的lora模型,加载到checkpoint里。input是对instruction数据的补充。instruction是问,output是回答。将这要训练的数据集丢到。
在cpu环境下通过xinference离线加载glm4-chat
本文介绍了RAG(检索增强生成)框架及其应用实践。RAG通过整合检索与生成,实现了知识更新无需重新预训练,并提升了模型回答的可解释性。文章详细解析了RAG的流程,包括文本分块、向量化、索引构建、检索、重排序和提示词工程等步骤。最后以Qwen大模型为例,展示了RAG的实战应用,包括PDF文本读取、分块处理、向量嵌入、相似度计算和语义搜索等关键环节,为读者提供了完整的RAG实现方案。