NIM 交互式聊天启动工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_93ce1c9f/nim-interactive-chat。
技能介绍
问题
本地部署 NVIDIA NIM 格式模型时,流程通常被拆成几步:先拉取镜像、创建容器、映射端口,再检查服务是否真正就绪,最后还要手动调用 OpenAI 兼容 API 才能对话。若旧容器未清理,或健康检查未完成就开始请求,就会出现端口占用、连接失败和对话中断等问题。
工作方式
- 生成脚本:一键创建启动脚本、停止脚本和 Python 交互式聊天客户端,减少手工编写启动逻辑。
- 容器管理:启动前自动删除同名旧容器,避免容器状态冲突。
- 就绪判断:等待健康检查通过后自动进入对话,把服务可用作为进入前端交互的前提。
- API 对接:使用 OpenAI 兼容接口,支持流式输出,并保持同一会话中的上下文。
- 资源参数:通过
gpu-memory-utilization控制显存占用,默认值为0.9。
适用边界
它适合本地 Docker 环境中运行 NGC、TGC 等 NVIDIA NIM 镜像,并快速进行聊天验证。输入 exit 后容器通常仍在后台运行,需要用停止脚本结束;使用前提包括 Docker、Python 3 和 openai 包,且镜像、模型名、端口映射都需要与本地环境匹配。
使用场景
- 在本地 Docker 中运行 Qwen3.5 NIM 镜像,启动前清理旧容器并等待健康检查通过。
- 调试 OpenAI 兼容接口时,用生成的 Python 客户端连续发送消息,检查流式输出和上下文保持。
- 验证 GPU 显存占用时,设置显存利用率后启动 NIM 容器,确认服务可对话。
- 接手本地模型演示环境时,用启动和停止脚本管理容器,避免手动 docker 命令遗漏清理。
适合人员
- 本地部署大模型的 AI 工程师,想少写 Docker 启动脚本并直接进入 NIM 模型对话。
- 模型服务测试人员,需要检查 OpenAI 兼容接口的流式输出、上下文保持和健康等待。
- GPU 资源运维工程师,想通过显存利用率参数控制本地 NIM 容器的资源占用。
- 模型演示负责人,希望用启动和停止脚本快速展示本地 Qwen 等 NIM 模型。