模型推理
geniex pull
下载模型并存储到本地。
从本地路径拉取:
pull 会将文件复制到 GenieX 缓存。拉取成功后可安全删除源文件,避免保留两份副本。geniex infer — LLM
启动与语言模型的交互式对话。
--compute)——选择运行模型的计算单元(默认:npu):
geniex infer — VLM
运行视觉语言模型推理,支持纯文本或图像输入:
geniex model
查看与重新配置已缓存的模型。
geniex model set-type
覆盖缓存模型清单中记录的模型类型。省略类型参数时会进入交互式选择。
geniex infer 走哪条路径:vlm 会连同权重一起加载 mmproj 投影器并接受图像 / 音频输入,llm 只加载语言权重。把多模态 GGUF 强制设为 llm,就是在权重 + 投影器装不进内存的板子上只跑其文本路径的方法。
geniex pull --model-type llm <model> 在下载时就写入同一字段,因此新拉取的模型无需再执行 set-type。geniex model list
列出带 qairt(NPU)构建的 Qualcomm AI Hub 模型。默认只列出与检测到的芯片兼容的模型,加 --all 可列出全部。
geniex serve
启动兼容 OpenAI 协议的本地服务器。API 详见本地服务器。
message.content 移到 message.reasoning_content,在单次请求中设置 reasoning_format 字段即可——详见分离推理内容。
日志
--log 是全局标志,控制 CLI 的日志输出。它与 GENIEX_LOG 环境变量等效,且当二者同时设置时优先于 GENIEX_LOG。
配置标志
以下标志可传给geniex infer,用于控制模型加载与生成行为。
采样器标志
控制模型在生成时如何选择 token。模型标志
控制模型加载、上下文与生成限制。增大上下文长度
上下文窗口(--nctx)是模型一次能容纳的内容上限。当对话增长超过该上限时会报 context length exceeded 错误。如何增大取决于运行时:
-
llama.cpp (GGUF):
--nctx <N>可在运行时抬升窗口,上限为模型训练时的最大值。窗口越大,占用的 KV 缓存内存越多。 -
Qualcomm AI Engine Direct (NPU): 上下文长度固化在编译好的模型包中,运行时无法抬升——
--nctx不生效。可改用:- 加
--sliding-window以在超限后继续对话:驱逐锚定前缀之外最旧的上下文,而不是报错。 - 如需真正更大的窗口,请从 Qualcomm AI Hub 获取按更长上下文编译的模型包。参见 Qualcomm AI Engine Direct 运行环境限制。
- 加
实用命令
Was this page helpful?