【字节跳动】100项大模型推理/训练的关键配置参数,涵盖显存管理(动态分配、量化卸载)、计算优化(并行策略、算子优化)、服务部署(预热、负载均衡)、安全监控(日志、容灾)等核心场景。
本文汇总了100项大模型推理/训练的关键配置参数,涵盖显存管理(动态分配、量化卸载)、计算优化(并行策略、算子优化)、服务部署(预热、负载均衡)、安全监控(日志、容灾)等核心场景。重点包括:动态显存分配策略(八十一)、低精度量化配置(八十二)、冷启动优化(八十三)、模型并行调度(七十三)、容灾自愈机制(七十七)、生成策略控制(九十二)等,形成完整的参数调优体系。这些参数通过显存/内存阈值控制、NUMA亲和性绑定、流量灰度发布等机制,实现性能、资源与稳定性的平衡,适用于大规模分布式训练与高并发推理场景。
### 八十一、动态显存管理参数
适配大模型推理/训练动态显存分配,规避显存溢出
```plaintext
mem.dynamic.allocate=1
mem.gpu.fraction=0.9
mem.reserved.gpu.mb=1024
mem.offload.enable=1
mem.offload.device=cpu
mem.swap.threshold=0.85
mem.fragment.merge=1
mem.pool.expand.step=256
```
1. `mem.dynamic.allocate=1`:开启GPU动态显存分配,按需申请不一次性占满
2. `mem.gpu.fraction=0.9`:进程最大占用单卡90%显存,预留空间给系统与杂项进程
3. `mem.reserved.gpu.mb=1024`:固定预留1024MB显存,防止突发任务抢占资源
4. `mem.offload.enable=1`:启用显存卸载,将部分模型参数移至内存
5. `mem.offload.device=cpu`:指定卸载目标为系统内存
6. `mem.swap.threshold=0.85`:显存使用率达85%时触发参数卸载
7. `mem.fragment.merge=1`:自动合并显存碎片,提升分配效率
8. `mem.pool.expand.step=256`:显存池单次扩容大小256MB
---
### 八十二、低精度量化配置
模型量化压缩,兼顾体积、速度与精度
```plaintext
quant.enable=1
quant.mode=int8
quant.activation.quant=1
quant.weight.quant=1
quant.calib.steps=200
quant.calib.dataset=default
quant.dynamic.range=1
quant.clip.value=6.0
```
1. `quant.enable=1`:开启模型量化功能
2. `quant.mode=int8`:采用INT8量化方案,主流提速压缩方案
3. `quant.activation.quant=1`:对激活值进行量化
4. `quant.weight.quant=1`:对模型权重进行量化
5. `quant.calib.steps=200`:量化校准迭代步数,提升量化精度
6. `quant.calib.dataset=default`:使用默认校准数据集
7. `quant.dynamic.range=1`:启用动态范围量化,适配不同输入数据
8. `quant.clip.value=6.0`:量化截断阈值6.0,抑制异常值影响
---
### 八十三、预热与冷启动优化参数
解决服务冷启动慢、首请求延迟高问题
```plaintext
warmup.enable=1
warmup.batch.count=10
warmup.interval.ms=500
warmup.input.path=/data/warmup/sample.json
preload.model=1
preload.on.start=1
idle.unload=0
idle.timeout=3600
```
1. `warmup.enable=1`:开启服务启动自动预热
2. `warmup.batch.count=10`:预热执行10轮推理请求
3. `warmup.interval.ms=500`:预热请求间隔500毫秒
4. `warmup.input.path=/data/warmup/sample.json`:指定预热用测试输入文件
5. `preload.model=1`:启动时完整加载模型至显存
6. `preload.on.start=1`:进程初始化阶段完成模型加载
7. `idle.unload=0`:空闲时不卸载模型,避免重复加载
8. `idle.timeout=3600`:服务空闲判定时长3600秒
---
### 八十四、多实例负载均衡参数
单机多实例、多节点负载调度配置
```plaintext
instance.load.balance=1
instance.max.load=0.8
instance.detect.interval=10
node.load.weight=1.0
load.cpu.weight=0.3
load.gpu.weight=0.6
load.mem.weight=0.1
migrate.threshold=0.2
```
1. `instance.load.balance=1`:开启多实例负载均衡调度
2. `instance.max.load=0.8`:单实例负载上限80%,不再分配新任务
3. `instance.detect.interval=10`:负载检测间隔10秒
4. `node.load.weight=1.0`:节点整体负载权重系数
5. `load.cpu.weight=0.3`:CPU负载在综合评分中占比0.3
6. `load.gpu.weight=0.6`:GPU负载在综合评分中占比0.6
7. `load.mem.weight=0.1`:内存负载在综合评分中占比0.1
8. `migrate.threshold=0.2`:实例负载差值超20%时触发任务迁移
---
### 八十五、文本输入输出处理参数
推理场景下文本编解码、长度限制与预处理配置
```plaintext
tokenizer.path=/model/tokenizer/
max.input.len=2048
max.output.len=1024
pad.token.id=0
eos.token.id=2
bos.token.id=1
stream.output=1
stream.interval.ms=20
```
1. `tokenizer.path=/model/tokenizer/`:分词器文件存放路径
2. `max.input.len=2048`:输入文本最大token长度2048
3. `max.output.len=1024`:生成文本最大token长度1024
4. `pad.token.id=0`:填充token对应ID
5. `eos.token.id=2`:结束符token对应ID
6. `bos.token.id=1`:起始符token对应ID
7. `stream.output=1`:开启流式输出,逐段返回结果
8. `stream.interval.ms=20`:流式数据推送间隔20毫秒
---
### 八十六、进程与线程池配置
全局线程、工作进程管理,优化并发能力
```plaintext
worker.process.num=8
worker.thread.num=32
thread.pool.queue=512
thread.pool.priority=normal
io.thread.num=16
compute.thread.num=24
thread.detach=1
thread.stack.size=8192
```
1. `worker.process.num=8`:启动8个工作进程
2. `worker.thread.num=32`:单进程工作线程数32
3. `thread.pool.queue=512`:线程池任务队列最大长度512
4. `thread.pool.priority=normal`:线程优先级设为普通
5. `io.thread.num=16`:独立IO线程数16,分离读写与计算
6. `compute.thread.num=24`:纯计算线程数24
7. `thread.detach=1`:启用线程分离模式,自动回收资源
8. `thread.stack.size=8192`:线程栈大小8192KB
---
### 八十七、API网关与接口配置
对外服务接口、路由、跨域与请求头控制
```plaintext
api.listen.ip=0.0.0.0
api.listen.port=8080
api.workers=4
api.cors.enable=1
api.cors.allow.all=1
api.max.body.size=67108864
api.timeout.read=15
api.timeout.write=30
```
1. `api.listen.ip=0.0.0.0`:监听所有网卡地址,允许外网访问
2. `api.listen.port=8080`:服务监听端口8080
3. `api.workers=4`:API服务工作进程数4
4. `api.cors.enable=1`:开启跨域访问支持
5. `api.cors.allow.all=1`:允许所有域名跨域请求
6. `api.max.body.size=67108864`:请求体最大限制64MB
7. `api.timeout.read=15`:请求读取超时15秒
8. `api.timeout.write=30`:响应写入超时30秒
---
### 八十八、缓存策略配置
模型中间结果、常用输入缓存,降低重复计算开销
```plaintext
cache.enable=1
cache.type=lru
cache.max.items=2048
cache.max.size.mb=4096
cache.ttl.s=1800
cache.persist=0
cache.hit.log=1
cache.evict.batch=16
```
1. `cache.enable=1`:启用结果缓存功能
2. `cache.type=lru`:采用LRU最近最少使用淘汰策略
3. `cache.max.items=2048`:缓存最大条目数2048
4. `cache.max.size.mb=4096`:缓存总大小上限4096MB
5. `cache.ttl.s=1800`:缓存数据有效期1800秒
6. `cache.persist=0`:关闭磁盘持久化缓存,仅内存缓存
7. `cache.hit.log=1`:记录缓存命中日志
8. `cache.evict.batch=16`:单次淘汰缓存条目数16
---
### 八十九、训练学习率与优化器参数
专属模型训练场景超参配置
```plaintext
optimizer.type=adamw
lr.init=2e-5
lr.warmup.steps=500
lr.decay.type=linear
lr.min=1e-6
weight.decay=0.01
grad.clip.norm=1.0
adam.beta1=0.9
```
1. `optimizer.type=adamw`:使用AdamW优化器
2. `lr.init=2e-5`:初始学习率2e-5
3. `lr.warmup.steps=500`:学习率预热步数500
4. `lr.decay.type=linear`:采用线性学习率衰减
5. `lr.min=1e-6`:学习率下限1e-6
6. `weight.decay=0.01`:权重衰减系数0.01,防止过拟合
7. `grad.clip.norm=1.0`:梯度裁剪范数1.0,抑制梯度爆炸
8. `adam.beta1=0.9`:Adam一阶矩估计系数
---
### 九十、数据集与采样配置
训练数据加载、打乱、采样相关配置
```plaintext
data.shuffle=1
data.shuffle.buffer=1024
data.prefetch=8
data.repeat.count=-1
data.drop.remainder=1
data.num.parallel.reads=12
data.cache.on.disk=0
data.augment.enable=0
```
1. `data.shuffle=1`:开启数据集随机打乱
2. `data.shuffle.buffer=1024`:打乱缓冲区大小1024条样本
3. `data.prefetch=8`:预加载8个批次数据
4. `data.repeat.count=-1`:数据集无限循环读取
5. `data.drop.remainder=1`:丢弃不足一个批次的剩余样本
6. `data.num.parallel.reads=12`:并行数据读取线程12个
7. `data.cache.on.disk=0`:不将数据集缓存至磁盘
8. `data.augment.enable=0`:关闭数据增强
---
### 七十二、CUDA 内存与算子优化参数
面向 GPU 算子性能、显存复用与计算调度优化
```plaintext
cuda.stream.num=16
cuda.malloc.threshold=4096
cuda.graph.enable=1
cuda.tf32.allow=1
cuda.allow.tf32.matmul=1
cuda.malloc.async=1
cuda.pinned.mem.enable=1
cuda.occupancy.max.blocks=128
```
1. `cuda.stream.num=16`:设置 CUDA 异步流数量,提升计算与数据拷贝的并行度
2. `cuda.malloc.threshold=4096`:内存池分配阈值(单位 KB),减少小显存分配开销
3. `cuda.graph.enable=1`:启用 CUDA Graph 捕获,减少推理/训练时的核启动开销
4. `cuda.tf32.allow=1`:允许使用 TF32 精度进行矩阵运算,在不显著损失精度的前提下提升 Ampere 及以上架构 GPU 性能
5. `cuda.allow.tf32.matmul=1`:仅在矩阵乘法算子上启用 TF32,兼顾性能与数值稳定性
6. `cuda.malloc.async=1`:启用异步显存分配,避免主线程被阻塞
7. `cuda.pinned.mem.enable=1`:启用固定内存分配,加速主机到设备的数据传输
8. `cuda.occupancy.max.blocks=128`:限制单 SM 上的最大活跃线程块数,避免过度占用资源导致调度效率下降
---
### 七十三、模型并行(TP/PP)调度参数
面向张量并行、流水线并行的任务切分与调度配置
```plaintext
model.tensor.parallel.size=4
model.pipeline.parallel.size=2
model.parallel.mode=hybrid
model.tp.allreduce.bucket.size=1048576
model.pp.num.micro.batches=8
model.pp.schedule=1F1B
model.parallel.overlap.comm=1
model.parallel.checkpoint.grad=1
```
1. `model.tensor.parallel.size=4`:张量并行度为 4,将单个算子切分到 4 个 GPU 上并行计算
2. `model.pipeline.parallel.size=2`:流水线并行度为 2,将模型层切分到 2 个阶段流水执行
3. `model.parallel.mode=hybrid`:启用混合并行模式(TP+PP+DP),适配大规模模型部署
4. `model.tp.allreduce.bucket.size=1048576`:张量并行 All-Reduce 通信的 bucket 大小(单位字节),优化通信效率
5. `model.pp.num.micro.batches=8`:流水线并行的微批数量,用于隐藏流水线气泡
6. `model.pp.schedule=1F1B`:采用 1F1B(1 Forward 1 Backward)流水线调度策略,平衡前向与反向计算负载
7. `model.parallel.overlap.comm=1`:启用通信与计算重叠,在计算的同时执行通信操作,提升吞吐量
8. `model.parallel.checkpoint.grad=1`:启用梯度检查点,减少反向传播时的显存占用
---
### 七十四、存储与 checkpoint 管理参数
面向训练 checkpoint 保存、加载与分布式存储适配
```plaintext
checkpoint.dir=/mnt/nfs/seed/checkpoints
checkpoint.save.interval=1000
checkpoint.max.keep=5
checkpoint.load.strict=1
checkpoint.async.save=1
checkpoint.sharding.enable=1
checkpoint.io.threads=8
checkpoint.compress.level=3
```
1. `checkpoint.dir=/mnt/nfs/seed/checkpoints`:指定 checkpoint 文件的存储路径,适配分布式共享存储
2. `checkpoint.save.interval=1000`:每 1000 步保存一次 checkpoint,平衡存储开销与故障恢复成本
3. `checkpoint.max.keep=5`:最多保留 5 个最新的 checkpoint 文件,避免磁盘空间溢出
4. `checkpoint.load.strict=1`:严格加载 checkpoint 参数,不允许出现参数不匹配的情况
5. `checkpoint.async.save=1`:启用异步 checkpoint 保存,避免阻塞训练主流程
6. `checkpoint.sharding.enable=1`:启用 checkpoint 分片存储,适配大模型参数的分布式读写
7. `checkpoint.io.threads=8`:设置 checkpoint 读写的 I/O 线程数,提升存储吞吐
8. `checkpoint.compress.level=3`:设置 checkpoint 压缩级别为 3,在压缩率与读写速度之间取得平衡
---
### 七十五、日志与监控埋点参数
面向集群运行状态监控、日志采集与告警配置
```plaintext
log.level=info
log.path=/var/log/seed/
log.rotate.max.size=1024
log.rotate.max.backups=5
metrics.enable=1
metrics.port=9090
metrics.interval=15
health.check.interval=30
```
1. `log.level=info`:日志输出级别为 info,记录关键运行事件与错误信息
2. `log.path=/var/log/seed/`:日志文件存储路径,适配集群日志收集系统
3. `log.rotate.max.size=1024`:单个日志文件最大为 1024MB,触发自动轮转
4. `log.rotate.max.backups=5`:最多保留 5 个历史轮转日志文件
5. `metrics.enable=1`:启用 Prometheus 格式指标采集,用于 Grafana 可视化监控
6. `metrics.port=9090`:指标暴露端口,供监控系统拉取数据
7. `metrics.interval=15`:指标采集间隔为 15 秒,平衡监控粒度与系统开销
8. `health.check.interval=30`:节点健康检查间隔为 30 秒,及时发现故障实例
---
### 七十六、安全与权限控制参数
面向集群访问控制、数据加密与安全审计配置
```plaintext
auth.enable=1
auth.token.path=/etc/seed/auth/token
network.encryption.enable=1
network.encryption.type=tls1.3
audit.log.enable=1
audit.log.path=/var/log/seed/audit/
container.seccomp.profile=default
container.capabilities.drop=all
```
1. `auth.enable=1`:启用 API 接口的身份验证,未授权请求直接拒绝
2. `auth.token.path=/etc/seed/auth/token`:指定身份验证 token 文件路径,支持密钥轮换
3. `network.encryption.enable=1`:启用节点间通信的 TLS 加密,防止数据被窃听或篡改
4. `network.encryption.type=tls1.3`:使用 TLS 1.3 协议加密通信,兼顾安全性与性能
5. `audit.log.enable=1`:启用操作审计日志,记录所有用户请求与系统变更
6. `audit.log.path=/var/log/seed/audit/`:审计日志存储路径,满足合规审计要求
7. `container.seccomp.profile=default`:应用默认 seccomp 安全配置,限制容器内的系统调用
8. `container.capabilities.drop=all`:移除容器的所有 Linux 特权能力,降低逃逸风险
---
### 七十七、故障自愈与容灾参数
面向节点故障、进程崩溃的自动恢复与容灾配置
```plaintext
ha.enable=1
ha.heartbeat.interval=5
ha.max.missed.heartbeats=3
restart.on.failure=always
max.restart.attempts=3
failover.timeout=60
data.replication.enable=1
data.replication.factor=2
```
1. `ha.enable=1`:启用高可用(HA)模式,支持节点故障自动切换
2. `ha.heartbeat.interval=5`:节点间心跳检测间隔为 5 秒,及时发现离线节点
3. `ha.max.missed.heartbeats=3`:连续丢失 3 次心跳后判定节点故障,触发故障转移
4. `restart.on.failure=always`:进程崩溃时自动重启,保障服务连续性
5. `max.restart.attempts=3`:最多尝试重启 3 次,避免死循环重启
6. `failover.timeout=60`:故障转移操作的超时时间为 60 秒,防止集群长时间不可用
7. `data.replication.enable=1`:启用数据副本复制,避免单点故障导致数据丢失
8. `data.replication.factor=2`:关键数据保留 2 份副本,平衡存储成本与可靠性
---
### 七十八、硬件亲和性与 NUMA 优化参数
面向 CPU/GPU/网卡的 NUMA 亲和性绑定与性能调优
```plaintext
numa.affinity.enable=1
cpu.pin.cores=auto
gpu.pin.numa=1
net.irq.affinity=auto
hugepages.enable=1
hugepages.size=2M
cpu.governor=performance
gpu.power.mode=persistence
```
1. `numa.affinity.enable=1`:启用 NUMA 节点亲和性绑定,减少跨 NUMA 节点访问延迟
2. `cpu.pin.cores=auto`:自动将进程绑定到对应 NUMA 节点的 CPU 核心上
3. `gpu.pin.numa=1`:将 GPU 与所在 NUMA 节点的 CPU、网卡绑定,提升本地通信效率
4. `net.irq.affinity=auto`:自动将网卡中断绑定到对应 NUMA 节点的 CPU 核心
5. `hugepages.enable=1`:启用大页内存,减少 TLB miss 带来的性能损耗
6. `hugepages.size=2M`:设置大页内存大小为 2MB,适配常见工作负载
7. `cpu.governor=performance`:设置 CPU 性能模式为 performance,禁用节能降频
8. `gpu.power.mode=persistence`:将 GPU 电源模式设置为持久模式,避免频率波动影响性能
---
### 七十九、批处理与请求队列管理参数
面向在线推理服务的请求队列、批处理与限流配置
```plaintext
batch.enable=1
batch.size.max=32
batch.timeout.us=1000
queue.size.max=1024
queue.timeout.s=30
rate.limit.rps=1000
backpressure.enable=1
backpressure.threshold=0.8
```
1. `batch.enable=1`:启用请求自动批处理,将多个用户请求合并为一个批次计算
2. `batch.size.max=32`:单批次最大请求数为 32,平衡延迟与吞吐量
3. `batch.timeout.us=1000`:批处理等待超时时间为 1000 微秒,超时立即执行当前批次
4. `queue.size.max=1024`:请求队列最大长度为 1024,超出后直接拒绝请求
5. `queue.timeout.s=30`:请求在队列中的最大等待时间为 30 秒,超时返回错误
6. `rate.limit.rps=1000`:服务每秒最大处理请求数为 1000,防止过载
7. `backpressure.enable=1`:启用背压机制,当队列使用率过高时拒绝新请求
8. `backpressure.threshold=0.8`:队列使用率达到 80% 时触发背压保护
---
### 八十、通信与网络优化参数
面向节点间网络、TCP/IP 栈与 RDMA 优化配置
```plaintext
network.tcp.syncookies=1
network.tcp.tw_reuse=1
network.tcp.fin_timeout=30
network.tcp.syn_retries=2
network.roce.enable=1
network.roce.ver=2
network.mtu=9000
network.rx_ring=4096
```
1. `network.tcp.syncookies=1`:启用 TCP SYN Cookies,防御 SYN Flood 攻击
2. `network.tcp.tw_reuse=1`:启用 TIME_WAIT 端口复用,缓解高并发场景下的端口耗尽问题
3. `network.tcp.fin_timeout=30`:缩短 TCP FIN 超时时间为 30 秒,加快连接回收
4. `network.tcp.syn_retries=2`:减少 TCP SYN 重试次数,避免无效连接占用资源
5. `network.roce.enable=1`:启用 RoCE(RDMA over Converged Ethernet),提升节点间通信带宽与延迟表现
6. `network.roce.ver=2`:使用 RoCE v2 协议,支持更灵活的网络拓扑
7. `network.mtu=9000`:将网卡 MTU 设置为 9000(巨帧),减少大数据传输时的分片开销
8. `network.rx_ring=4096`:增大网卡接收队列长度为 4096,减少高负载下的丢包率
---
### 九十一、LoRA 微调专属配置
适配大模型轻量微调,参数高效训练场景
```plaintext
lora.enable=1
lora.rank=16
lora.alpha=32
lora.dropout=0.05
lora.target.modules=q_proj,v_proj
lora.bias=none
lora.merge.onload=1
lora.save.full=0
```
1. `lora.enable=1`:开启LoRA低秩适配微调
2. `lora.rank=16`:设置LoRA秩为16,平衡参数量与效果
3. `lora.alpha=32`:LoRA缩放系数
4. `lora.dropout=0.05`:LoRA层dropout概率,防止过拟合
5. `lora.target.modules`:指定作用的目标投影层
6. `lora.bias=none`:不训练偏置项
7. `lora.merge.onload=1`:加载时自动合并LoRA权重与原模型
8. `lora.save.full=0`:仅保存LoRA增量权重,不保存完整模型
---
### 九十二、推理生成策略参数
控制文本生成逻辑、采样方式与生成规则
```plaintext
generate.temperature=0.7
generate.top_p=0.9
generate.top_k=40
generate.repetition.penalty=1.05
generate.do.sample=1
generate.num.beams=1
generate.stop.words=###
generate.presence.penalty=0.0
```
1. `generate.temperature=0.7`:温度系数,控制生成随机性
2. `generate.top_p=0.9`:核采样阈值,筛选累计概率靠前token
3. `generate.top_k=40`:每次采样仅选取概率最高的40个token
4. `generate.repetition.penalty=1.05`:重复惩罚,抑制文本重复
5. `generate.do.sample=1`:启用随机采样生成
6. `generate.num.beams=1`:束搜索数量,1为关闭束搜索
7. `generate.stop.words`:指定生成终止词,匹配后结束输出
8. `generate.presence.penalty=0.0`:存在惩罚,默认关闭
---
### 九十三、容器资源限额参数
Docker/K8s 容器运行资源限制,防止资源抢占
```plaintext
container.cpu.limit=16
container.cpu.request=8
container.mem.limit.gb=64
container.mem.request.gb=32
container.gpu.usage=all
container.ulimit.nofile=65535
container.ulimit.nproc=4096
container.tmpfs.size.gb=16
```
1. `container.cpu.limit=16`:容器CPU核心上限16核
2. `container.cpu.request=8`:容器最小申请8核CPU资源
3. `container.mem.limit.gb=64`:内存上限64GB
4. `container.mem.request.gb=32`:最小申请32GB内存
5. `container.gpu.usage=all`:容器使用全部挂载GPU
6. `container.ulimit.nofile=65535`:最大文件句柄数
7. `container.ulimit.nproc=4096`:容器最大进程数
8. `container.tmpfs.size.gb=16`:临时文件系统大小16GB
---
### 九十四、分布式初始化参数
集群多机多卡分布式启动、通信初始化配置
```plaintext
distributed.enable=1
distributed.backend=nccl
distributed.init.method=tcp
distributed.master.addr=192.168.1.100
distributed.master.port=29500
distributed.world.size=16
distributed.local.rank=0
distributed.timeout=1800
```
1. `distributed.enable=1`:开启分布式训练/推理
2. `distributed.backend=nccl`:使用NCCL作为GPU通信后端
3. `distributed.init.method=tcp`:基于TCP完成分布式初始化
4. `distributed.master.addr`:主节点IP地址
5. `distributed.master.port=29500`:主节点通信端口
6. `distributed.world.size=16`:集群总进程数
7. `distributed.local.rank=0`:本机进程编号
8. `distributed.timeout=1800`:分布式通信超时时间,单位秒
---
### 九十五、离线批量任务参数
后台离线推理、批量数据处理调度配置
```plaintext
batch.task.enable=1
batch.task.concurrency=4
batch.task.input.path=/data/batch/in/
batch.task.output.path=/data/batch/out/
batch.task.split.line=1
batch.task.fail.retry=2
batch.task.retry.interval=10
batch.task.log.per.line=0
```
1. `batch.task.enable=1`:开启离线批量任务功能
2. `batch.task.concurrency=4`:批量任务并发执行数4
3. `batch.task.input.path`:批量任务输入数据目录
4. `batch.task.output.path`:批量结果输出目录
5. `batch.task.split.line=1`:按行切分每条待处理数据
6. `batch.task.fail.retry=2`:任务失败自动重试2次
7. `batch.task.retry.interval=10`:重试间隔10秒
8. `batch.task.log.per.line=0`:不逐行打印详细日志
---
### 九十六、模型版本与热加载参数
多模型版本管理、不停机热加载切换模型
```plaintext
model.version.manage=1
model.current.version=v2.1
model.rollback.enable=1
model.hot.reload=1
model.reload.interval=60
model.reload.check.md5=1
model.keep.old.version=1
model.preload.standby=1
```
1. `model.version.manage=1`:启用模型版本管理
2. `model.current.version=v2.1`:当前运行模型版本
3. `model.rollback.enable=1`:支持版本回滚
4. `model.hot.reload=1`:开启模型热加载,无需重启服务
5. `model.reload.interval=60`:定时检测模型更新间隔60秒
6. `model.reload.check.md5=1`:通过MD5校验文件完整性
7. `model.keep.old.version=1`:加载新模型时保留旧版本
8. `model.preload.standby=1`:预加载备用模型版本
---
### 九十七、OOM 防护与内存告警参数
显存/内存溢出预警、保护与日志捕获
```plaintext
oom.protect.enable=1
oom.mem.threshold=0.92
oom.gpu.threshold=0.90
oom.alert.level=warn
oom.alert.log=1
oom.kill.unsafe.process=0
oom.dump.memory=1
oom.dump.path=/var/dump/
```
1. `oom.protect.enable=1`:开启内存溢出防护
2. `oom.mem.threshold=0.92`:系统内存使用率92%触发预警
3. `oom.gpu.threshold=0.90`:GPU显存使用率90%触发预警
4. `oom.alert.level=warn`:告警级别为警告
5. `oom.alert.log=1`:记录内存告警日志
6. `oom.kill.unsafe.process=0`:不主动杀死业务进程
7. `oom.dump.memory=1`:异常时导出内存快照
8. `oom.dump.path`:内存快照存放目录
---
### 九十八、代理与外部依赖访问参数
服务调用外部接口、模型仓库、存储代理配置
```plaintext
proxy.enable=1
proxy.http=http://192.168.1.200:8088
proxy.https=http://192.168.1.200:8088
proxy.no.local=1
model.repo.url=http://model-repo:8000
model.repo.timeout=20
repo.auth.user=admin
repo.auth.pwd=******
```
1. `proxy.enable=1`:启用网络代理
2. `proxy.http`:HTTP代理地址与端口
3. `proxy.https`:HTTPS代理地址与端口
4. `proxy.no.local=1`:内网地址不走代理
5. `model.repo.url`:模型仓库服务地址
6. `model.repo.timeout=20`:访问模型仓库超时20秒
7. `repo.auth.user`:模型仓库登录用户名
8. `repo.auth.pwd`:模型仓库登录密码
---
### 九十九、灰度发布与流量切分参数
线上服务灰度放量、流量比例分配配置
```plaintext
gray.release.enable=1
gray.flow.ratio=0.2
gray.ip.whitelist=1
gray.whitelist.file=/etc/gray/ip.list
gray.rollback.auto=1
gray.monitor.flow=1
gray.max.error.rate=0.01
gray.switch.interval=300
```
1. `gray.release.enable=1`:开启灰度发布功能
2. `gray.flow.ratio=0.2`:灰度流量占比20%
3. `gray.ip.whitelist=1`:开启IP白名单灰度
4. `gray.whitelist.file`:白名单IP列表文件路径
5. `gray.rollback.auto=1`:异常自动切回旧版本
6. `gray.monitor.flow=1`:实时监控灰度流量数据
7. `gray.max.error.rate=0.01`:错误率超1%触发回滚
8. `gray.switch.interval=300`:流量调整检测间隔300秒
---
### 一百、全局调试与诊断参数
线上问题排查、性能分析、调试开关配置
```plaintext
debug.mode=0
debug.trace.api=0
debug.trace.gpu=0
profile.enable=1
profile.interval=60
profile.output=/var/log/profile/
strict.mode=1
verbose.log=0
```
1. `debug.mode=0`:关闭全局调试模式,线上默认关闭
2. `debug.trace.api=0`:关闭API调用链路追踪
3. `debug.trace.gpu=0`:关闭GPU算子执行追踪
4. `profile.enable=1`:开启性能采样分析
5. `profile.interval=60`:性能采样间隔60秒
6. `profile.output`:性能分析报告输出目录
7. `strict.mode=1`:开启严格校验模式,拦截非法参数
8. `verbose.log=0`:关闭冗余详细日志,减少IO开销
更多推荐




所有评论(0)