Agent Skills
返回列表
Token Optimizer Plus 优化代理

Token Optimizer Plus 优化代理

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_884ff669/token-optimizer-plus。

技能介绍

问题:LLM 调用把大量 Token 花在重复与噪音上

AI Agent 高频调用 OpenAI、Anthropic、Ollama 时,请求里常包含重复上下文、冗余说明、表格和过长历史。直接发给模型会抬高费用,也可能逼近上下文窗口,导致需要人工截断或丢失关键信息。

工作方式:本地透明代理 + 四策略管道

token-optimizer-plus 以本地代理运行,默认监听 localhost:8899。把应用的 API base URL 指向它之后,请求会先经过优化管道,再转发到上游服务。管道包括:

  • 语义去重:减少含义相近的上下文重复
  • 精确去重:清理完全重复片段
  • 噪音过滤:删除低价值文本
  • 语义压缩:可选调用本地 Ollama 做进一步压缩

它还会维护 data/to_stats.db,在 http://localhost:8899/dashboard 展示累计节省 Token、费用、策略贡献、会话历史和请求明细,方便判断哪些内容最浪费 Token。

适用边界:适合文本 API,不适合所有链路

该方案主要优化文本请求,不处理图片、音频等多模态内容;默认只绑定本机,使用 HTTP 转发,且对 SSE / 流式响应优化有限。生产使用前建议运行仪表盘自检,并定期备份 data/ 目录。

使用场景

  • 调试 Agent 应用 Token 过高时,把 API 指向本地代理,并查看哪些请求被去重、过滤或压缩。
  • 控制 OpenAI 或 Ollama 调用费用时,用仪表盘累计查看节省 Token、费用和各策略贡献。
  • 对话历史过长逼近上下文窗口时,让代理自动过滤噪音并压缩重复上下文,再转发给模型。
  • 排查重复代码、表格或说明文案浪费 Token 时,在请求明细里展开查看策略拆分和节省率。

适合人员

  • 维护 AI Agent 应用的工程师:希望在不改业务代码的前提下降低每次 LLM 调用的 Token 成本。
  • 使用 OpenAI 或 Ollama 的开发者:想量化哪些请求文本被重复、噪音或表格浪费。
  • 负责模型预算的技术负责人:需要查看累计节省费用、会话历史和策略贡献来评估成本。
  • 做上下文工程的应用开发者:需要自动压缩长对话或长文档,减少上下文溢出风险。