AirLLM
AirLLM 是一款开源大语言模型推理库,通过每次仅在 GPU 上保留单层模型的分层内存管理技术,使 70B 参数模型能在单张 4GB 显存显卡上运行,无需量化、蒸馏或剪枝。适合在消费级硬件上部署超大规模开源模型的开发者和研究人员。
AirLLM 是一款开源大语言模型推理库,通过每次仅在 GPU 上保留单层模型的分层内存管理技术,使 70B 参数模型能在单张 4GB 显存显卡上运行,无需量化、蒸馏或剪枝。适合在消费级硬件上部署超大规模开源模型的开发者和研究人员。
提供方: lyogavin
适合用户
- 大模型开发者与研究人员
- 在消费级 GPU 上部署大模型的个人开发者
- 需要运行超大规模开源模型的 AI 工程师
不适合
- 推理时原始模型会先被逐层分解保存,需要大量磁盘空间
- MacOS 上仅支持 Apple Silicon 芯片
- 预取功能目前仅 AirLLMLlama2 支持
- 加载 QWen 或 ChatGLM 时需使用 AutoModel 而非 AirLLMLlama2
- Kimi K3 要求 CUDA 12 版 torch 且无 CUDA 13 预编译 flash-attn wheel
- Kimi K3 要求 transformers 4.56.x,不支持 5.x
核心能力
- 低显存大模型推理
- 块量化模型压缩
- 主流开源模型广泛支持
- MacOS Apple Silicon 支持
使用步骤
- 快速开始推理流程
- 启用模型压缩加速
适用场景
- 在低端 GPU 上运行大语言模型 - 在消费级 GPU 上部署大模型的个人开发者
- 在 Mac 上运行大语言模型 - 大模型开发者与研究人员
访问与价格
可用状态: 当前可用
价格信息: 开源
支持平台: Linux, macOS, 自托管
价格说明: 开源项目,Apache-2.0 许可证,可免费使用。
官方入口
常见问题
- 遇到 MetadataIncompleteBuffer 错误怎么办?
- 遇到 ValueError: max() arg is an empty sequence 怎么办?
- 遇到 401 Client Error(gated model)怎么办?
来源核验
资料核验于 2026-08-02