登录社区云,与社区用户共同成长
邀请您加入社区
NVIDIA 面向数据中心多节点环境的开源分布式推理服务框架 Dynamo 的组件 AIConfigurator 和 Grove,分享它们分别如何解决 PD 分离架构下大模型推理的两个核心落地难题:在庞大配置空间中高效寻优,以及在 Kubernetes 上优雅编排多组件推理服务。P/D 分离的抉择,到 Prefill/Decode 资源的配比,再到并行策略的设定,庞大的参数空间使得人工调优如同大海
在使用Helm chart时,可以通过以下选项自定义设置。这些选项可在安装时通过--set进行指定。下表列出了最常用的选项。如果您希望使用自定义的驱动容器镜像(例如版本 465.27),可以按照以下步骤构建自定义的驱动容器镜像:通过在构建 Docker 镜像时指定参数来重建驱动容器。有关参考信息,驱动容器的 Dockerfile 可在Git 仓库中找到。使用适当的 Dockerfile 构建容器。
三、修改containerd配置文件使用gpu容器运行时,二、安装nvidia-device-plugin插件。部署一个简易测试含gpu的pod。一、安装gpu容器运行时。