gcp-cloudrun简单使用
演示 GCP Cloud Run 的简单用法:部署普通服务、部署 H100 GPU 任务,以及通过 YAML 挂载目录。
演示 GCP Cloud Run 的简单用法:部署普通服务、部署 H100 GPU 任务,以及通过 YAML 挂载目录。
介绍在 Kubernetes 中使用 APISIX Ingress Controller,演示路由、证书、basic-auth 认证与通配符、Prometheus 等配置。
整理 GPU 训练集群运维三板斧:InfiniBand 网络排查、NCCL-tests 带宽验收,以及 XID 与 DCGM 运行监控。
讲解在 Docker 与 Kubernetes 中启用 NVIDIA GPU,包括安装 container-toolkit、配置容器运行时并部署 device-plugin
记录 Linux 安装 NVIDIA 驱动与 CUDA 的准备工作,含固定 IP、禁用 nouveau、配置远程桌面及驱动安装
同一批云服务分别用控制台点选和 Pulumi 代码创建,并对比两种做法的适用场景与取舍。
记录一次 ClickHouse 表级数据迁移:从旧服务远程写入新服务,含性能参数调整、停止与恢复合并等操作步骤。