Skip to main content

前置条件

  • 已安装 Python SDK——详见安装
  • 了解运行环境选择——qairt 用于 Qualcomm AI Hub 模型,llama_cpp 用于任意 GGUF。
SDK 与 Hugging Face transformers 设计一致——通过 AutoModelForCausalLM.from_pretrained() 加载,再调用 .generate()

LLM 推理(GGUF)

任意来自 Hugging Face 的 GGUF 模型均可通过 llama_cpp 运行。模型权重在首次使用时自动下载。

LLM 推理(QAIRT)

来自 Qualcomm AI Hub 的预编译模型包通过 qairt 运行环境完全在 Hexagon NPU 上运行。使用 device_map="qairt"(或 "npu")。模型权重在首次使用时自动下载。

VLM 推理(QAIRT)

首先下载示例图片:
随后运行推理:

Jupyter Notebook 教程

笔记本电脑用户可参考 examples/python/windows.ipynb 中的逐步 Jupyter Notebook,覆盖环境配置与端到端推理。

下一步

API 参考

Python SDK 的全部类、方法与参数。

模型

支持的模型、Hugging Face 上的 GGUF,以及自行转换的 Qualcomm AI Engine Direct 模型包。