登录社区云,与社区用户共同成长
邀请您加入社区
《AI时代后端工程师的核心价值:从代码实现到工程判断》 本文通过一个订单接口案例,深刻揭示了AI编程工具普及后后端工程师的角色转变。作者发现AI能快速生成语法正确、功能完整的代码,但真正的工程挑战在于处理现实世界的复杂性:重复请求、并发冲突、部分失败等情况下的系统行为。 文章指出,现代后端开发的核心已从"代码实现"转向"工程判断",工程师需要专注于: 定义业
GPT、Claude、LLaMA、DeepSeek……这些名字背后,都是这套骨架。看懂 Transformer,你就看懂了大模型的一半。2026 年一晃已经过半,AI 大模型的热潮不仅没有降温,反而持续升温!金融行业用大模型做风控、医疗依靠 AI 解析影像,电商、制造、教育各行各业,都在把 AI 融入日常业务。曾经热闹的 “百模大战”,早就告别单纯比拼模型参数,正式进入落地应用时代。懂业务、懂 A
本文介绍了NanoGPT-ZH项目,这是一个从零手工实现的中文GPT文本生成模型。项目采用纯PyTorch实现,不依赖任何Transformer库,完整实现了包括Token嵌入、位置编码、多头自注意力等核心组件。该模型专为中文优化,参数规模约7M,适合在个人电脑上训练。文章详细解析了Transformer架构,包括Decoder-Only结构、因果自注意力机制等技术细节,并提供了清晰的代码实现和数
RouteRAG通过"统一策略+两阶段奖励"将文本/图谱检索转化为端到端强化学习问题,让小模型能自主规划"何时查、查什么"。其统一动作空间和三段式检索引擎使模型可选择最优检索策略,两阶段训练先保证正确性再优化效率。实验显示,仅用1万条数据训练的小模型在多跳问答中性能超越同尺寸模型,甚至媲美GPT-4o-mini,大幅提升检索效率和准确性。
摘要:Kimi团队提出创新性Attention Residuals架构,突破传统残差连接的局限性。该技术通过动态注意力机制实现历史层特征的智能聚合,在48B参数模型中展现出显著优势:训练效率提升1.25倍,GPQA-Diamond基准成绩提高7.5分,推理延迟仅增加2%。核心创新包括伪查询向量机制、RMSNorm归一化和分块注意力设计,既保留传统残差连接的优点,又解决了深度陷阱、信息稀释等关键问题
本文介绍了基于ViT(Vision Transformer)的MINIST手写数字识别实现。通过将28×28的灰度图像分割为4×4的patch,使用卷积层将每个patch映射为64维向量,并添加cls_token和位置编码。构建了一个包含2层Transformer编码器的小型ViT模型,使用交叉熵损失和Adam优化器进行30轮训练。实验表明该模型能有效学习图像特征,实现手写数字分类。代码提供了训练
本文基于Transformer编码器实现,重点解析解码器的三大核心机制:因果自注意力、交叉注意力和自回归推理。通过手动验证展示了因果掩码如何阻断未来信息(上三角区域置为-∞),确保自回归生成的正确性;交叉注意力则实现编码器-解码器信息融合(Q来自解码器,K/V来自编码器)。实验验证了注意力权重的精确匹配(差异为0),并可视化多头注意力模式。最终完成3层解码器堆叠,实现逐步生成目标序列的自回归推理过
更多详细内容请访问http://能源预测MATLAB实现基于Transformer编码器(Transformer)进行光伏功率预测的详细项目实例(含完整的程序,GUI设计和代码详解)资源-CSDN下载 https://download.csdn.net/download/xiaoxingkongyuxi/92687474更多详细内容请访问http://能源预测MATLAB实现基于Transfo
本文介绍了为昇腾NPU贡献大模型算子的完整流程。开发者需要fork ops-transformer仓库,创建算子目录并实现三个核心部分:op_kernel(Ascend C计算逻辑)、op_host(算子注册和tiling策略)、op_tiling(预计算参数)。关键难点在于tiling调优,需确保分块策略满足NPU硬件对齐要求。开发完成后需通过精度和性能测试,最后提交PR。简单算子约需3-5天,
摘要:本文介绍了如何在昇腾NPU上快速部署和使用ops-transformer大模型算子,无需编写Ascend C代码。主要内容包括:1) 环境要求检查(CANN版本和PyTorch适配);2) 一键编译流程及常见错误处理;3) FlashAttention和MoE融合算子的调用示例;4) 性能对比验证方法。整个过程可在5分钟内完成,为后续模型推理优化提供基础。文章还提供了进一步学习路径和贡献指南
文章摘要:使用LLMs进行团队建设时,代理出错且无法学习是常见瓶颈。微调是突破方法,但传统微调设置复杂。现代技术如GRPO(群体相对策略优化)和RULER(自动评估代理表现)简化了微调过程,无需手工奖励函数或标记数据。ART框架将GRPO应用于现实代理,支持工具调用和多轮对话,通过RULER自动评估实现高效训练。小型模型经微调可超越大型模型,降低成本与延迟。配套资源可帮助开发者快速掌握大模型应用开
但是,到这里为止,我们讨论的核心任务仍然主要是:图像分类。也就是输入一张图像,输出一个类别标签。ViT 证明了:图像可以被切成 patch token,然后输入 Transformer Encoder 进行图像分类。DeiT 进一步说明:通过更好的训练策略和蒸馏机制,ViT 可以在不依赖超大规模外部数据的情况下更高效地训练。这就引出一个非常重要的问题:原始 ViT 能不能直接作为目标检测和语义分割
刚接触昇腾CANN那会,我以为 ops-transformer 就是个普通的算子仓库,和 ops-math、ops-nn 没什么区别。后来跑一个 70B 模型的推理任务,显存直接爆了,才发现大模型的注意力计算才是真正的吞显存怪兽——而 ops-transformer 里那个 FlashAttention,是昇腾NPU上唯一能把这头怪兽关进笼子的东西。ops-transformer 是昇腾CANN
dispatch_kernel_agent.py 是 KernelAgent 系统中的调度组件,负责将 subgraph_extractor.py 生成的子图(JSON 格式)转换为具体的 Triton 内核生成任务,并调度 TritonKernelAgent 来生成和验证这些内核。