Agent Skills
返回列表
LLM 基准测试与自我优化

LLM 基准测试与自我优化

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_fcba917f/llm-benchmark。

技能介绍

问题

当团队需要比较多个大模型 API 的性能时,常见痛点是:指标不稳定、缺少首 Token 延迟、Token 吞吐、百分位统计,也没有持续压测与历史趋势。人工脚本往往难以覆盖 temperature、max_tokens、并发、多语言等维度,结果也不容易复现和归档。

工作方式

本技能把 LLM API 测试拆成可执行流程:

  • 基准测试:运行 quick 或 full 模式,采集 TTFT、TPS、ITL、P50/P90/P99 与成功率。
  • 压力测试:指定 duration 和 concurrency,支持断点续传、指数退避、检查点与崩溃恢复。
  • 报告与对比:生成 HTML/PDF 报告,对多模型做横向对比,并基于历史数据给出趋势判断。
  • 自我优化:通过 optimize suggest、auto-tune 对 temperature、max_tokens 等参数做推荐或网格搜索,评分目标可围绕 tps、ttft、balance 选择。

适用边界

API 需要是 OpenAI 兼容格式,例如 /v1/chat/completions。自动调参会实际发送大量请求,可能影响配额和耗时;压力测试适合在可控环境运行。本地 Ollama 也可通过兼容端点测试,但密钥通常填写 ollama。

使用场景

  • 新接入 OpenAI 兼容 API 时,验证首 Token 延迟、吞吐和成功率是否达标。
  • 上线前对本地 Ollama 与云上模型做持续压测,确认长时长运行不崩溃且可断点恢复。
  • 比较三个候选模型的 TPS、TTFT 和综合评分,生成 HTML 报告供选型评审使用。
  • 根据生产低延迟或开发平衡场景,推荐 max_tokens 与 temperature,并网格搜索最优组合。

适合人员

  • 负责模型接入联调的工程师:需要快速判断 API 连通性、延迟和吞吐是否满足上线标准。
  • 做模型选型的产品或算法负责人:需要多模型横向对比并导出可评审的测试报告。
  • 压测平台或 SRE 工程师:需要稳定运行长时长负载、检查点恢复和趋势分析。
  • 提示词或服务参数调优工程师:需要基于历史结果推荐 temperature 与 max_tokens。