logo AI编程社区

AI编程社区
商务合作咨询人工智能入门机器学习入门深度学习入门机器学习基础知识
去全站搜索看看?

登录社区云

登录社区云,与社区用户共同成长

AI编程社区

邀请您加入社区

欢迎加入社区

欢迎加入社区

ab测试
  • 两个大模型同时翻车了--LLM应用A/B测试避坑实战

    本文通过对比测试GLM-5.1和Qwen3-8B模型,总结了四个关键发现:1)Prompt泄露是LLM通病,需依赖管道层防御而非模型自身;2)模型延迟与参数量无必然联系,推理基础设施影响更大;3)主流模型均已具备稳定输出JSON能力;4)83毫秒的回归测试套件是模型切换的安全网。文章详细介绍了A/B测试框架设计、自动评分机制和Mock驱动的回归测试方法,强调模型评估应基于数据而非直觉,并提供了应对

    长空凝视
    2026-07-18 21:56:05
     247 
     7 
    #ab测试#语言模型
  • 快手 AB 场景提速 145 倍,从 Spark 到 Apache Doris 的加速实践

    快手 AB 指标生产场景从 Spark 升级到 Doris 性能最大提升 145 倍、资源消耗下降 72%,一方面得益于 Doris 在 Pipeline 异步执行、向量化计算引擎、C++ 高性能运行时等架构优势,另一方面是快手基于 Doris 针对 AB 场景的深度优化:Colocate JOIN、Local distinct count、C++ Native UDF、workload grou

    SelectDB技术团队
    2026-07-06 11:36:44
     686 
     14 
    #spark#大数据#ab测试 +3
没有更多了
回到
顶部
logo 提供社区服务与技术支持
logo 提供社区服务与技术支持
©1999-2023北京创新乐知网络技术有限公司 京ICP备19004658号