Skip to main content

模型推理

geniex pull

下载模型并存储到本地。
从本地路径拉取:
pull 会将文件复制到 GenieX 缓存。拉取成功后可安全删除源文件,避免保留两份副本。
精度(量化)(仅 llama.cpp) 对于 GGUF 模型,CLI 会提示选择精度:
Q4_0 在 Hexagon NPU 上支持最佳。详见支持的精度(量化)。
Qualcomm AI Hub 模型已预量化——无需选择。

geniex infer — LLM

启动与语言模型的交互式对话。
思考模式——控制模型是否在回复前展示推理过程:
计算单元选择(通过 --compute)——选择运行模型的计算单元(默认:npu):
将 GGML_HEXAGON_NDEV 设置为与 --compute 中设备 ID 数量一致。qairt 模型会将设备列表强制转为 NPU 并输出警告。性能数据参见 MTP 教程。
Qualcomm AI Hub 模型仅在 NPU 上运行。使用 --compute cpu 或 --compute gpu 会返回错误。

geniex infer — VLM

运行视觉语言模型推理,支持纯文本或图像输入:
如果只需文本输入,直接启动并对话即可。若要使用图像输入,请提供绝对路径或将图片文件直接拖入终端:

geniex model

查看与重新配置已缓存的模型。

geniex model set-type

覆盖缓存模型清单中记录的模型类型。省略类型参数时会进入交互式选择。
类型决定 geniex infer 走哪条路径:vlm 会连同权重一起加载 mmproj 投影器并接受图像 / 音频输入,llm 只加载语言权重。把多模态 GGUF 强制设为 llm,就是在权重 + 投影器装不进内存的板子上只跑其文本路径的方法。
geniex pull --model-type llm <model> 在下载时就写入同一字段,因此新拉取的模型无需再执行 set-type。

geniex model list

列出带 qairt(NPU)构建的 Qualcomm AI Hub 模型。默认只列出与检测到的芯片兼容的模型,加 --all 可列出全部。

geniex serve

启动兼容 OpenAI 协议的本地服务器。API 详见本地服务器。
要把思考模型的思维链从 message.content 移到 message.reasoning_content,在单次请求中设置 reasoning_format 字段即可——详见分离推理内容。

日志

--log 是全局标志,控制 CLI 的日志输出。它与 GENIEX_LOG 环境变量等效,且当二者同时设置时优先于 GENIEX_LOG。

配置标志

以下标志可传给 geniex infer,用于控制模型加载与生成行为。

采样器标志

控制模型在生成时如何选择 token。

模型标志

控制模型加载、上下文与生成限制。

增大上下文长度

上下文窗口(--nctx)是模型一次能容纳的内容上限。当对话增长超过该上限时会报 context length exceeded 错误。如何增大取决于运行时:
  • llama.cpp (GGUF): --nctx <N> 可在运行时抬升窗口,上限为模型训练时的最大值。窗口越大,占用的 KV 缓存内存越多。
  • Qualcomm AI Engine Direct (NPU): 上下文长度固化在编译好的模型包中,运行时无法抬升——--nctx 不生效。可改用:

实用命令