登录社区云,与社区用户共同成长
邀请您加入社区
本文通过对比测试GLM-5.1和Qwen3-8B模型,总结了四个关键发现:1)Prompt泄露是LLM通病,需依赖管道层防御而非模型自身;2)模型延迟与参数量无必然联系,推理基础设施影响更大;3)主流模型均已具备稳定输出JSON能力;4)83毫秒的回归测试套件是模型切换的安全网。文章详细介绍了A/B测试框架设计、自动评分机制和Mock驱动的回归测试方法,强调模型评估应基于数据而非直觉,并提供了应对
快手 AB 指标生产场景从 Spark 升级到 Doris 性能最大提升 145 倍、资源消耗下降 72%,一方面得益于 Doris 在 Pipeline 异步执行、向量化计算引擎、C++ 高性能运行时等架构优势,另一方面是快手基于 Doris 针对 AB 场景的深度优化:Colocate JOIN、Local distinct count、C++ Native UDF、workload grou