transformers 一致——通过 AutoModel*.from_pretrained() 加载模型,再调用 .generate() 进行推理。
AutoModelForCausalLM
加载因果语言模型的工厂——同时支持纯文本与多模态。文本模型返回GenieXLLM,识别为多模态时返回 GenieXVLM(如 phi4_multimodal、qwen3.5-vl、gemma4)。
from_pretrained()
返回:
GenieXLLM 或 GenieXVLM(按模型自动判断)
AutoModelForVision2Seq
加载视觉语言/多模态模型的工厂。返回GenieXVLM 实例。
from_pretrained()
接受所有 AutoModelForCausalLM.from_pretrained() 的参数,加上:
返回:
GenieXVLM
GenieXLLM
由AutoModelForCausalLM.from_pretrained() 返回的纯文本模型实例。
generate()
基于格式化好的 prompt 字符串运行文本生成。
返回:
GenerateOutput(stream=True 时为 TextIteratorStreamer)
reset()
重置对话状态并清空 KV 缓存。
save_kv_cache(path) / load_kv_cache(path)
将 KV 缓存保存到/加载自指定文件路径(str)。
close()
释放模型句柄与资源。也支持上下文管理器:
GenieXVLM
由AutoModelForVision2Seq.from_pretrained() 返回的视觉语言模型实例。
generate()
参数与 GenieXLLM.generate() 一致,新增:
GenerateOutput(stream=True 时为 TextIteratorStreamer)
reset() / close()
同 GenieXLLM。
ModelTokenizer
通过model.tokenizer 访问。提供与 transformers 兼容的 chat template 接口。
apply_chat_template()
使用模型内置的 chat template 格式化对话消息。
返回:
str —— 可直接传给 model.generate() 的格式化 prompt。
输出类
GenerateOutput
由model.generate() 返回。
ProfileData
TextIteratorStreamer
由model.generate(..., stream=True) 返回。生成时按片段产出解码后的文本。
模型管理器
CLI 使用的同一个模型管理器也可在程序中通过geniex.model_manager 调用。
SDK 函数
Was this page helpful?