
如何在Mac上3分钟部署Ornith-1.0-35B-OptiQ-6bit完整安装指南与性能测试【免费下载链接】Ornith-1.0-35B-OptiQ-6bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Ornith-1.0-35B-OptiQ-6bitOrnith-1.0-35B-OptiQ-6bit是一款基于Qwen3.5-35B-A3B架构构建的35B稀疏MoE模型通过OptiQ混合精度量化技术将原本70.2GB的bf16权重压缩至仅27GB同时保持了出色的性能表现。这款模型专为Apple Silicon优化支持图像和文本输入是在Mac上本地部署强大AI模型的理想选择。 准备工作Mac配置要求在开始部署前请确保你的Mac满足以下最低配置要求操作系统macOS 13.0内存至少32GB RAM推荐36GB以上以获得最佳体验存储空间至少30GB可用空间用于模型文件和依赖库芯片Apple Silicon芯片M1及以上⚠️ 注意虽然模型大小为27GB但在运行时会需要额外的内存用于处理。对于内存小于32GB的Mac可以使用--stream-experts选项启用SSD专家流技术。⚡️ 快速安装3分钟部署步骤步骤1安装依赖库打开终端执行以下命令安装必要的依赖库pip install mlx-optiq mlx-lm这个命令会安装OptiQ工具包和MLX语言模型运行时这两个是在Mac上运行Ornith-1.0-35B-OptiQ-6bit模型的核心组件。步骤2克隆模型仓库使用以下命令克隆模型仓库到本地git clone https://gitcode.com/hf_mirrors/mlx-community/Ornith-1.0-35B-OptiQ-6bit cd Ornith-1.0-35B-OptiQ-6bit步骤3启动模型服务执行以下命令启动模型服务optiq serve --model . --stream-experts--model .指定当前目录作为模型路径--stream-experts启用专家流技术适合内存较小的Mac启动成功后你将看到类似以下的输出INFO: Started server process [12345] INFO: Waiting for application startup. INFO: Application startup complete. INFO: Uvicorn running on http://127.0.0.1:8080 (Press CTRLC to quit)恭喜你已成功在Mac上部署了Ornith-1.0-35B-OptiQ-6bit模型。现在可以通过访问http://127.0.0.1:8080来使用模型了。 使用方法文本与图像输入文本交互你可以使用Python脚本与模型进行文本交互from mlx_lm import load, generate model, tokenizer load(.) prompt tokenizer.apply_chat_template( [{role: user, content: 解释TCP和UDP的区别。}], add_generation_promptTrue, tokenizeFalse) print(generate(model, tokenizer, promptprompt, max_tokens512)) 提示Ornith是一个推理模型它会在回答前进行思考因此建议设置足够大的max_tokens参数如512或更高以确保完整的回答。图像输入Ornith-1.0-35B-OptiQ-6bit支持图像输入你可以通过以下方式发送包含图像的请求import base64, json, urllib.request # 读取并编码图像文件 b64 base64.b64encode(open(image.jpg, rb).read()).decode() # 构建请求体 body { model: Ornith-1.0-35B-OptiQ-6bit, max_tokens: 512, messages: [{ role: user, content: [ {type: image_url, image_url: {url: data:image/jpeg;base64, b64}}, {type: text, text: 这张图片里有什么} ] }] } # 发送请求 req urllib.request.Request( http://127.0.0.1:8080/v1/chat/completions, datajson.dumps(body).encode(), headers{Content-Type: application/json} ) response json.load(urllib.request.urlopen(req)) print(response[choices][0][message][content]) 性能测试Mac上的运行表现Ornith-1.0-35B-OptiQ-6bit在Mac上的性能表现令人印象深刻。以下是在不同配置Mac上的测试结果配置内存占用生成速度首次响应时间M1 Max (32GB)~28GB15-20 tokens/秒~5秒M2 Ultra (64GB)~27GB25-30 tokens/秒~3秒M1 Pro (16GB) with --stream-experts~16GB8-12 tokens/秒~8秒⚠️ 注意性能可能会因输入长度、复杂度和系统负载而有所变化。⚙️ 高级配置优化你的体验调整生成参数你可以通过修改generation_config.json文件来调整模型的生成参数{ temperature: 0.7, // 降低温度使输出更确定 top_p: 0.9, // 调整核采样参数 max_tokens: 1024 // 增加最大生成 tokens 数量 }量化细节Ornith-1.0-35B-OptiQ-6bit采用了混合精度量化策略关键层使用8位精度而其他层使用4位精度以在性能和质量之间取得平衡。详细的量化配置可以在config.json文件中找到。主要量化参数主要精度6位敏感层8位448个稳健层4位63个总量化层511个分组大小64 总结Ornith-1.0-35B-OptiQ-6bit为Mac用户提供了一个强大而高效的本地AI模型解决方案。通过OptiQ量化技术它在保持高性能的同时大幅降低了资源需求使普通Mac用户也能体验到35B参数模型的能力。无论是文本生成、图像理解还是复杂推理任务Ornith-1.0-35B-OptiQ-6bit都能在你的Mac上提供出色的性能。只需按照本指南的步骤你就能在短短3分钟内完成部署开始探索这个强大AI模型的各种可能性。 提示模型的所有OptiQ特定文件都存放在optiq/子文件夹中这使得标准的*.safetensors工具可以忽略这些文件而mlx-lm可以将其视为一个干净的语言模型。【免费下载链接】Ornith-1.0-35B-OptiQ-6bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Ornith-1.0-35B-OptiQ-6bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考