📌 一句话摘要
BaseRT 是一款专为 Apple Silicon 优化的本地 AI 推理引擎,在 M5 Pro 上相比 llama.cpp 和 MLX 在提示词处理阶段最高实现 6.4 倍和 3.9 倍性能提升,支持多种开源模型并提供 OpenAI 兼容接口。
📝 详细摘要
文章介绍了 BaseRT,一个专为 Apple Silicon 优化的本地大模型推理引擎。通过在 M5 Pro 上的基准测试,展示了其在 Prefill(提示词处理)阶段相比 llama.cpp 最高 6.4 倍、相比 MLX 最高 3.9 倍的性能提升;Decode(生成)阶段也有最高 1.75 倍提升。文章列出了多款模型(Qwen、Llama、Gemma)在不同提示长度下的详细对比数据,并提供了安装、模型下载、对话运行及 API 启动的快速上手指南。BaseRT 利用 M5 芯片的 Tensor Core 和 Metal 4 Tensor API 实现加速。
💡 主要观点
- BaseRT 在 M5 Pro 上 Prefill 阶段性能提升显著,最高达 6.4 倍。 对比 llama.cpp 和 MLX,BaseRT 在提示词处理阶段利用 M5 Tensor Core 和 Metal 4 Tensor API 获得巨大优势,尤其在较长提示下加速比更高。
- Decode 阶段提升有限,最高 1.75 倍。 生成速度的提升幅度小于 Prefill,但仍有实际价值,尤其对大参数模型(如 Qwen3.6-35B-A3B)提升明显。
- 安装使用简单,兼容 OpenAI API,便于集成。 通过命令行工具即可快速部署,提供标准 API 接口,降低了在 Mac 上运行本地模型的入门门槛。