LLM 基准测试与自我优化
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_fcba917f/llm-benchmark。
技能介绍
问题
当团队需要比较多个大模型 API 的性能时,常见痛点是:指标不稳定、缺少首 Token 延迟、Token 吞吐、百分位统计,也没有持续压测与历史趋势。人工脚本往往难以覆盖 temperature、max_tokens、并发、多语言等维度,结果也不容易复现和归档。
工作方式
本技能把 LLM API 测试拆成可执行流程:
- 基准测试:运行
quick或full模式,采集TTFT、TPS、ITL、P50/P90/P99与成功率。 - 压力测试:指定
duration和concurrency,支持断点续传、指数退避、检查点与崩溃恢复。 - 报告与对比:生成 HTML/PDF 报告,对多模型做横向对比,并基于历史数据给出趋势判断。
- 自我优化:通过
optimize suggest、auto-tune对temperature、max_tokens等参数做推荐或网格搜索,评分目标可围绕tps、ttft、balance选择。
适用边界
API 需要是 OpenAI 兼容格式,例如 /v1/chat/completions。自动调参会实际发送大量请求,可能影响配额和耗时;压力测试适合在可控环境运行。本地 Ollama 也可通过兼容端点测试,但密钥通常填写 ollama。
使用场景
- 新接入 OpenAI 兼容 API 时,验证首 Token 延迟、吞吐和成功率是否达标。
- 上线前对本地 Ollama 与云上模型做持续压测,确认长时长运行不崩溃且可断点恢复。
- 比较三个候选模型的 TPS、TTFT 和综合评分,生成 HTML 报告供选型评审使用。
- 根据生产低延迟或开发平衡场景,推荐 max_tokens 与 temperature,并网格搜索最优组合。
适合人员
- 负责模型接入联调的工程师:需要快速判断 API 连通性、延迟和吞吐是否满足上线标准。
- 做模型选型的产品或算法负责人:需要多模型横向对比并导出可评审的测试报告。
- 压测平台或 SRE 工程师:需要稳定运行长时长负载、检查点恢复和趋势分析。
- 提示词或服务参数调优工程师:需要基于历史结果推荐 temperature 与 max_tokens。