Skip to content

典型部署场景

什么时候读:你想确认昇腾能做哪些事、对应用什么技术栈,据此判断当前的部署目标该走哪条实施路径。

昇腾覆盖 AI 的训练、推理、边缘、算子开发四类场景。本节按部署目标列出对应的技术选型与实施入口,帮助你直接对照自己的需求定位。

一、场景与技术选型总览

部署目标关键技术栈对应板块
大模型微调 / 预训练LLaMA-Factory、MindSpeed训练
LLM 推理服务(服务化)MindIE、vLLM-Ascend、SGLang推理
LLM 应用平台(RAG / 工作流 / Agent)Dify + 昇腾推理后端Dify 部署
存量服务器推理加速Atlas 300I 推理卡 + 推理引擎推理卡
GPU 模型/算子迁移torch_npu、Triton-Ascend、Ascend C迁移 · 算子
边缘计算 / 算法验证Atlas 200I DK A2 开发套件开发套件

二、场景明细与实施入口

场景 A:在昇腾上微调 / 预训练大模型

  • 适用:需要私有化 / 行业大模型,数据不出域。
  • 技术栈:LLaMA-Factory(微调)、MindSpeed(大规模预训练)。
  • 实施路径:环境搭建 → 微调/训练 → 权重导出 → 部署推理。
  • 前置条件:环境搭建 全链路跑通。

场景 B:部署 LLM 推理服务

  • 适用:把已训练/微调模型做成可线上调用的推理服务。
  • 技术栈三选一:
  • 出口统一为 OpenAI 兼容 API,可直接对接现有应用。

场景 C:搭建 LLM 应用平台(RAG / 工作流 / Agent)

  • 适用:给业务方提供可视化、低代码的 LLM 应用底座。
  • 技术栈:Dify
  • 关键点:先跑通一个昇腾推理后端,再把其 OpenAI 兼容地址接入 Dify。

场景 D:存量服务器推理加速(插卡)

  • 适用:复用现有服务器,通过插 Atlas 300I 系列推理卡提升推理能力。
  • 技术栈:推理卡 + MindIE 或 vLLM-Ascend。
  • 关键点:板卡的物理安装、PCIe 枚举、驱动/CANN 配套,见 推理卡

场景 E:GPU 模型 / 算子迁移

场景 F:边缘计算 / 算法验证

  • 适用:边缘推理、算法原型验证。
  • 技术栈:Atlas 200I DK A2 开发套件。

三、回到主线

无论走哪个场景,环境搭建都是统一前置。若你刚开始,先按 从零到上手:7 步走 打完环境,再进入具体场景。

相关

AscendMate · AscendLA · GitHub 统计(近14天):仓库访问 次 · 独立访客 人 · 克隆