国产大模型统一路由
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_1a470ba8/cn-llm-router。
技能介绍
问题
调用多家国产大模型时,工程师通常要处理分散的 API key、不同厂商的请求协议、模型能力差异、成本统计和并发控制。手动选模型容易浪费预算,批量任务又可能把本机 CPU/内存打满。这个技能把 12 家国产模型收敛到一个命令行入口,让路由、调用、计费、缓存和降级在同一套流程里完成。
工作方式
它是一个纯 Python 标准库实现的 CLI,除讯飞星火的可选 websocket-client 外不强制依赖第三方包。密钥只来自环境变量,不落盘、不打包。核心链路是 prompt → 任务分类 → 策略引擎 → 厂商 adapter → 模型调用,同时旁路写入成本与本地缓存。route 可在不调用 API 的情况下给出建议;chat 支持流式、系统提示词和 JSON 输出;report 聚合跨厂商花费、成功率与延迟;hardware 根据 CPU/内存限制并发和批大小;cache 用相似度加长度惩罚减少重复调用。v2.1 后的 auto 策略会读取模型能力画像,在推理、代码、长文任务中优先选择匹配项;无网络或无 Key 时也能用 Mock 模式跑通链路。
注意
它不是 Agent 框架,不做微调、向量库或 RAG;模型推荐基于本地注册表与经验画像,不是实时基准测试。语义缓存可能误命中,金融、代码、实时查询建议加 --no-cache。流式 token 计数多为估算,精确账单以厂商控制台为准。
使用场景
- 调用 DeepSeek、通义、Kimi 等多个国产模型前,先用 route 查看推荐与成本策略,再执行 chat。
- 批量总结、翻译、抽取长文档时,用 chat 流式调用、report 聚合花费,并开启 cache 减少重复 API。
- 在无网络或未配 API Key 的开发机上,用 --mock 跑通 chat、report、budget、cache 调试链路。
- 低配机器上执行批量任务时,依赖 hardware 自动限制并发与批大小,避免占满 CPU/内存。
适合人员
- 维护多个国产模型 Key 的后端工程师,希望用一个命令选模型并统计跨厂商花费。
- 需要处理批量文档摘要和翻译的算法工程师,希望控制成本、限制并发并保留离线 Mock 调试。
- 在低配开发机上做 Agent 原型验证的开发者,希望不占满本机资源且可断网调试。
- 负责 AI 服务预算治理的平台工程师,希望查看月报、设置预算告警并排查 429/401 错误。