登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍了使用Ollama在本地部署大语言模型的完整指南。主要内容包括:Ollama的安装方法(支持macOS/Linux/Windows)、常用模型(如Qwen2.5、CodeLlama等)的下载运行、API服务的启动与调用。通过Python代码示例展示了基础对话和流式输出功能,并实战构建了支持代码生成/解释/审查的CLI工具。还介绍了VSCode插件集成和Flask Web应用开发,最后给出硬
本文介绍了基于FastAPI框架部署三种AI模型服务的方法。目标检测服务使用YOLOX模型,提供图像检测接口返回类别、坐标和置信度;身份识别服务采用ReID模型,通过特征比对实现奶牛身份识别;行为识别服务基于C3D模型,对上传视频进行行为分类。每个服务均包含健康检查、文件上传和检测三个接口,采用FastAPI构建RESTful API并处理跨域请求。身份识别服务需预先构建特征库用于相似度比对。文章
你拿到需求后,第一个想的不应该是代码,而是:定故事 → 定角色 → 画流程 → 写一页纸。
对技术感兴趣的读者,简单说说实现思路。:LLM 推理引擎 + HTTP API,用 Hono 框架提供接口,node-llama-cpp 做 GGUF 模型加载和推理apps/web:React 前端,TanStack Router + Tailwind CSS + shadcn/ui,支持深色/浅色主题:共享组件库端到端类型安全:用 Hono RPC 做类型共享,服务端定义路由,前端用创建客户端
如果你是 Java 基础项目,我也能帮你阅读、调试和修改其中的代码,协助定位报错。- ❌ 我不直接替你代写整篇论文,但我可以为你提供系统核心架构图、数据库关系图以及核心功能逻辑说明,为你写论文扫清一切代码障碍。👋 同学你好,因为淋过雨,所以想为大家撑一把伞,如果你正在找那种“到处撞车、报错连篇的套壳模板”,那我这里可能不太适合你。- 保证代码的独立性,代码结构和命名规范完全个性化,支持代码查重,
我花了几天时间,做了个API 公益站 —— 飞秒云引擎 (Femto Cloud)。无需邮箱即可注册,只需提供用户名和密码。,minimax等众多模型。
本文介绍了基于LangChain的智能会议纪要助手系统,该系统通过AI技术自动处理会议录音并生成结构化纪要。系统采用前后端分离架构,后端使用Python+FastAPI,前端基于Vue3+ElementPlus,数据存储采用MySQL。核心功能包括:通过阿里云Fun-ASR实现语音转写和说话人分离,利用LangChain编排通义千问大模型分步生成会议摘要、关键词、待办事项和发言人总结,最终自动拼装
该平台定位为公益站点,旨在提供的公益模型调用服务。用户无需邮箱,仅使用用户名和密码即可注册使用。
因为如果向量维度很大,Q和K的点积结果会很大,导致Softmax之后梯度极小,模型学不动。后来我想明白了——因为sin和cos能产生不同频率的波形,不同的位置就有不同的“指纹”,模型就能区分谁在前谁在后。你想过没有:我们考研时背得滚瓜烂熟的链式法则,在这里就是让模型变聪明的核心引擎。词嵌入解决了“每个词是什么”,但没解决“每个词在什么位置”。我们有一个词表(比如1000个词),每个词对应一个128
Python全栈开发学习摘要 本文系统梳理Python全栈开发知识体系,涵盖: Python核心:基础语法(数据类型/流程控制)、函数、面向对象(封装/继承/多态)、高级特性(生成器/装饰器/协程) 开发环境:Linux常用命令、Docker容器化部署(镜像/容器/数据卷) Web开发:FastAPI框架(路由/异步支持)、SQLAlchemy ORM技术 进阶内容: 并发编程(多进程/多线程/协
智能金融问答平台开发实践 本文介绍了一个融合自然语言处理与量化分析的智能金融问答平台,采用FastAPI+Vue3技术栈实现。项目核心创新在于: 双引擎架构:结合规则引擎(精准数据查询)与大语言模型(自然语言生成),通过意图识别模块自动解析用户查询,映射到10+种分析函数; RAG增强:采用FAISS向量库实现金融知识检索,提升专业问答准确性; 全流程工具链:包含数据清洗、7种机器学习模型、技术指
本文详细介绍如何利用 Python 生态中的 LangChain/LlamaIndex 框架,结合 FastAPI 构建后端服务,使用 Streamlit 开发前端界面,并集成本地部署的 Ollama 与 Qwen 大语言模型,打造一套完全离线、可运行于企业内网环境的 RAG(检索增强生成)知识问答系统。文章将从系统架构设计、环境搭建、核心代码实现、前后端集成、模型本地化部署到最终系统展示,提供完
我是大二生(开学就大三了),前阵子期末周太忙一直没写文章,近日考完试终于能休息会了,在此记录自己的一些思考。
还有隐私顾虑——机器"听"你说话,数据怎么存、怎么用,得透明。你说"我嗓子不舒服想喝点温的",它就能结合库存,推荐温水或润喉类饮品。现在的机器,本质上是你把需求"翻译"成屏幕操作:翻页、点选、付款。你有没有想过,有一天站在售货机前不用戳屏幕、不用翻菜单,直接说一句"来瓶不太甜的饮料",机器就能给你推荐合适的那瓶?所以短期看,对话式交互更可能先在安静、封闭的场景(办公室、酒店、社区)试点,而不是一下
FastAPI成为大模型应用开发的首选框架,因其轻量高效且易于维护,相比Flask更规范,比Django更简洁。通过继承Pydantic的BaseModel实现类型校验,类似TypeScript的解决方案。示例展示了一个计算器API,使用枚举定义运算符,通过泛型响应类规范返回格式。虽然Python的导入语法(from...import)和工具链(PyCharm)让Java开发者略感不适,但Fast
前几天帮一个朋友排查线上问题,他们的大模型应用突然开始报429,查了半天发现是前端直接拿API Key调厂商接口,流量一上来就把额度打爆了,而且因为没做统一日志,根本不知道是哪个用户消耗的Token。这其实是个挺典型的场景。2026年了但很多团队还停留在"能跑起来就行"的阶段,没把API这层真正工程化。自建一个Chat API网关并不复杂,但能解决一堆生产痛点。
本文介绍了一个基于FastAPI和vLLM的多模态HTTP服务架构设计。服务采用分层设计:FastAPI负责业务逻辑(图片上传、限流、日志等),vLLM专注模型推理。主要特点包括:1) 通过请求队列控制并发;2) IP级限流;3) 图片预处理;4) 业务与模型解耦,支持独立扩展。服务提供/chat接口接收图片和问题,返回模型响应,并支持通过环境变量配置各项参数。这种分层架构提高了系统的可维护性和扩
模型蒸馏是解决大语言模型(LLM)部署成本高、显存占用大等问题的关键技术,通过让小模型学习大模型的行为,在保持性能的同时降低资源需求。其核心是从输出分布进行知识迁移,利用温度参数软化概率分布,结合硬标签和软标签损失进行训练。主要类型包括离线、在线、自蒸馏和特征级蒸馏。LLM蒸馏面临生成式任务、能力差距等挑战,常用序列级和指令蒸馏方法。蒸馏具有模型压缩、推理加速等优势,但也存在性能天花板和教师依赖等
API 兼容复用:DeepSeek 兼容 OpenAI 接口,直接用openaiSDK 即可集成,零额外学习成本全链路异步:从数据库(aiosqlite)到 HTTP(FastAPI)到 LLM 调用(AsyncOpenAI),全异步实现,高并发友好追踪嵌入式设计:用量追踪逻辑内嵌在对话流程中(track_chat方法),业务代码无需感知WebSocket 实时推送:轻量级的连接管理器 + 广播模
本文介绍了如何在Coze平台上搭建一个智能体(Agent),并详细描述了从创建Agent到测试实际效果的全过程。首先,用户需要在Coze平台上创建一个新的Agent,并参考相关教程完成前置步骤。接着,进入Coze操作台,设置面试开场白,并选择适合中文处理的百川.4语言模型。然后,在“人设与回复逻辑”部分添加对话内容解析相关内容。最后,通过“预览与调试”功能输入对话内容,测试智能体的解析效果。结果显
这样配置nginx之后,避免nginx对流式输出的内容缓存,避免造成前端流式展示的卡顿。解决前端无法响应后端流式输出的问题。
连接fastapi 的websockets提示connection rejected (403 Forbidden)定义路由函数时websocket参数未指定类型正确的如下:
版本太低导致,重新安装。
本文详细记录了基于 Apifox CLI + GitLab CI 构建接口自动化测试流水线的完整实施过程。项目采用 Spring Boot 3.2.1 + Java 17 技术栈,通过 Docker 部署 GitLab Runner,将 API 测试无缝集成到 CI/CD 工作流中。文档涵盖四个核心阶段:GitLab Runner 部署配置、Apifox 测试场景创建(包含用户 CRUD 5 个接
面向0基础的FastAPI教程:4.JWT 认证与权限控制 —— 给接口加 “安全锁”
Redis 与 FastAPI 的组合,是构建高性能、高可用 Web 服务的黄金搭档。通过合理使用缓存,可显著提升系统吞吐;借助分布式锁,能在多实例环境下保障数据一致性。但技术没有银弹——缓存带来复杂性,锁引入性能开销。真正的高手,不是会用工具,而是知道何时用、怎么用、以及不用。掌握本文所讲的模式与原则,你已具备在真实项目中驾驭 Redis 与 FastAPI 的能力。下一步,不妨尝试结合 Cel
Linux 部署核心:前端仅传dist,后端传源码 +,分别启动服务并开放端口;后端必用虚拟环境,避免依赖冲突,服务后台运行用nohup(简易)/systemd(正式);前端用快速部署,高并发场景替换为 Nginx,均需适配 SPA 路由避免刷新 404;端口开放是关键,内网访问失败优先检查 Linux 防火墙是否开放 8080/8003 端口;更新项目仅需覆盖文件并重启服务,无需重新配置环境,简