// PC530 技术论坛 v1.0
● online 登录 / 注册
返回列表
人工智能与数据科学

Mac mini M4 pro 搭建本地大模型,文字对话、图片视频生成


机器型号:Apple M4 Pro 48GB 26.6.1 (25G76)

下面按“本机私有部署、稳定优先”编写。全部命令都在 Mac 的“终端”中执行。

最终组成:

  • Ollama:运行文字模型
  • Open WebUI:聊天、图片理解、文档知识库
  • Draw Things:图片生成、图片编辑、视频生成
  • ComfyUI:后续需要复杂工作流时再安装

一、检查机器和磁盘

uname -m
system_profiler SPHardwareDataType
df -h /

第一条应显示:

arm64

建议至少保留:

  • 基础文字模型:40GB
  • 图片模型:40~100GB
  • 视频模型与生成文件:100GB以上
  • 系统空闲空间:始终保留100GB左右

如果当前可用空间低于250GB,建议先准备雷电/USB4 NVMe固态硬盘。

二、安装Homebrew

先检查:

brew --version

如果提示找不到命令,安装Homebrew:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Apple Silicon机器安装完成后执行:

echo 'eval "$(/opt/homebrew/bin/brew shellenv)"' >> ~/.zprofile
eval "$(/opt/homebrew/bin/brew shellenv)"

验证:

brew --version

更新软件源:

brew update

三、安装Ollama

安装原生Ollama服务:

brew install ollama

启动并设置登录后自动运行:

brew services start ollama

检查状态:

brew services list

测试API:

curl http://127.0.0.1:11434/api/version

能看到版本JSON即为正常。Homebrew当前为Apple Silicon提供Ollama原生安装包,并包含MLX相关支持。Homebrew Ollama

不要同时安装ollama-app和Homebrew服务版,保留上面的服务版即可。

常用服务命令

brew services start ollama
brew services stop ollama
brew services restart ollama

如果服务启动失败,可以前台诊断:

brew services stop ollama
ollama serve

诊断结束按Control+C,再重新启动服务:

brew services start ollama

四、下载文字模型

1. 主力模型

ollama pull qwen3.6:35b-a3b

这个Q4_K_M模型约24GB,作为日常主力模型。Qwen3.6 35B-A3B

2. 快速模型

ollama pull qwen3.5:9b

该模型约6.6GB,用于快速问答、摘要和Open WebUI后台任务。Qwen3.5 9B

3. 知识库向量模型

ollama pull bge-m3

约1.2GB,支持中文、多语言文档检索。

4. 可选编程模型

如果需要给Continue、Cline、OpenCode等开发工具使用,再下载:

ollama pull qwen3-coder:30b

约19GB,不是必装。Qwen3.6本身也有较强编程能力。

5. 查看已下载模型

ollama list

预期至少出现:

qwen3.6:35b-a3b
qwen3.5:9b
bge-m3

6. 测试中文对话

ollama run qwen3.6:35b-a3b

进入后输入:

请用中文介绍你自己,并说明你是否能理解图片。

退出:

/bye

测试快速模型:

ollama run qwen3.5:9b

五、安装Open WebUI

安装桌面版:

brew install --cask open-webui

Homebrew提供Apple Silicon原生Open WebUI Desktop安装包。Open WebUI Homebrew

启动:

open -a "Open WebUI"

第一次启动时:

  1. 选择本地运行。
  2. 创建本机管理员账户。
  3. 这个账户只是本地Open WebUI账户,不需要注册云端服务。
  4. 第一个创建的账户自动成为管理员。

连接Ollama

进入:

Admin Settings
→ Connections
→ Ollama

填写:

http://127.0.0.1:11434

保存并刷新模型列表。

如果连接正常,应该看到:

  • qwen3.6:35b-a3b
  • qwen3.5:9b
  • bge-m3

Open WebUI原生支持连接Ollama及OpenAI兼容接口。Open WebUI与Ollama

六、配置Open WebUI

1. 设置主模型

默认聊天模型:

qwen3.6:35b-a3b

后台任务模型:

qwen3.5:9b

后台任务包括标题生成、标签、搜索词整理等,不需要占用主力模型。

2. 设置上下文

进入:

Admin Settings
→ Models
→ qwen3.6:35b-a3b
→ Advanced Parameters

设置:

num_ctx = 32768

qwen3.5:9b同样设置:

num_ctx = 32768

不要直接设置128K或256K。上下文越大,占用的统一内存越多。Open WebUI官方也建议根据硬件明确设置num_ctx上下文设置说明

3. 配置文档知识库

进入管理设置中的Documents、Knowledge或RAG设置,具体菜单名称可能随版本略有变化。

设置:

Embedding Engine: Ollama
Ollama URL: http://127.0.0.1:11434
Embedding Model: bge-m3

建议参数:

Chunk Size: 1000
Chunk Overlap: 150
Top K: 5

完成后可以上传PDF、Markdown、Word或TXT文件进行本地问答。

4. 推荐开关

建议启用:

  • Image Upload
  • Vision
  • Knowledge/RAG
  • Context Compaction
  • Native Tool Calling

如果可以设置压缩阈值,使用:

26000 tokens

这样对话接近32K时会先压缩旧内容,减少超出上下文的情况。

七、安装Draw Things

安装:

brew install --cask draw-things

启动:

open -a "Draw Things"

Homebrew当前提供macOS原生Draw Things版本。Draw Things Homebrew

第一次打开时:

  1. 允许创建模型与输出目录。
  2. 选择Local Compute。
  3. 云端账户可以跳过。
  4. 计算设备保持Automatic或GPU。
  5. 不要选择CPU Only。

八、下载图片模型

在Draw Things中进入模型管理页面,优先从Official Models下载,模型名称可能有少量版本后缀。

1. 快速生图模型

下载:

Z-Image Turbo

量化版本优先级:

6-bit或应用标记为Recommended的版本

用途:

  • 快速测试提示词
  • 写实人像
  • 日常配图
  • 批量生成草稿

首次使用不要自己更换Sampler,直接应用官方Recommended配置。

2. 主力高质量模型

下载:

FLUX.2 [klein] 4B

优先选择:

8-bit S / 8-bit / Recommended

如果没有上述版本,选择6-bit。

用途:

  • 高质量文生图
  • 参考图编辑
  • 多图片参考
  • 固定人物形象
  • 海报和产品图

FLUX.2 Klein 4B支持生成、编辑和多参考输入,官方公布的运行显存约13GB。FLUX.2 Klein

3. 中文海报与编辑模型

可选下载:

Qwen Image
Qwen Image Edit

优先选择8-bit量化版本。

适合:

  • 中文文字
  • 海报
  • 图片局部修改
  • 人物换背景
  • 保留主体进行多轮编辑

4. 推荐生图参数

初次测试:

分辨率:1024 × 1024
Batch Size:1
Seed:随机
Steps:使用Recommended
Sampler:使用Recommended
生成数量:1

确认稳定后再尝试:

1024 × 1536
1536 × 1024

不要一开始就使用2048像素和批量4张。

九、安装视频模型

在Draw Things模型管理中查找或导入:

Wan 2.2 TI2V 5B

优先选择:

5B
6-bit / 8-bit / Recommended量化版

Draw Things已支持Wan 2.2 5B模型和LoRA导入。Draw Things更新记录

推荐起步参数

模式:Image to Video
分辨率:768 × 448 或 832 × 480
时长:3~5秒
帧率:16fps
Batch Size:1
帧数:49~81
Tiled Decoding:开启

建议先生成一张满意的人物图片,再做图生视频。它通常比直接文生视频更容易保持人物一致性。

生成视频前释放文字模型

查看内存中的模型:

ollama ps

释放主模型:

ollama stop qwen3.6:35b-a3b

如果快速模型也在运行:

ollama stop qwen3.5:9b

Ollama默认会在闲置约5分钟后释放模型,也可以用ollama stop立即释放。Ollama模型内存管理

防止Mac在视频生成时休眠

打开一个新的终端窗口,执行:

caffeinate -dimsu

视频完成后按:

Control+C

十、可选安装ComfyUI

初期可以不装。只有需要以下功能时再安装:

  • 节点式复杂工作流
  • ControlNet
  • 批量自动处理
  • Open WebUI调用生图工作流
  • 社区Wan工作流
  • 更复杂的视频控制

从官方页面下载macOS Apple Silicon版:

ComfyUI macOS安装页面

安装步骤:

  1. 下载DMG。
  2. 拖入Applications。
  3. 启动Comfy Desktop。
  4. 创建一个Stable实例。
  5. 安装目录保持默认。
  6. 模型共享目录保持默认:
~/ComfyUI-Shared
  1. 后端应识别为:
MPS / Apple Silicon

在ComfyUI中进入:

Workflow
→ Browse Templates
→ Video
→ Wan 2.2 5B

先运行官方模板,不要一开始安装大量第三方节点。ComfyUI官方桌面版支持Apple Silicon和Metal/MPS。ComfyUI系统要求

十一、日常使用顺序

文字聊天

brew services start ollama
open -a "Open WebUI"

选择:

qwen3.6:35b-a3b

快速聊天

选择:

qwen3.5:9b

图片生成

ollama stop qwen3.6:35b-a3b
open -a "Draw Things"

视频生成

ollama stop qwen3.6:35b-a3b
ollama stop qwen3.5:9b
caffeinate -dimsu

然后在Draw Things中运行Wan 2.2。

十二、更新与维护

更新应用:

brew update
brew upgrade ollama
brew upgrade --cask open-webui draw-things

更新模型:

ollama pull qwen3.6:35b-a3b
ollama pull qwen3.5:9b
ollama pull bge-m3

查看模型:

ollama list

查看正在占用内存的模型:

ollama ps

删除不需要的模型:

ollama rm 模型名称

检查系统内存压力:

memory_pressure

查看内存占用:

top -o mem

十三、最终验收

依次执行:

brew services list
curl http://127.0.0.1:11434/api/version
ollama list
ollama ps

最终应达到:

  • Ollama服务状态为started
  • API能返回版本信息
  • Open WebUI能显示Qwen模型
  • Qwen3.6能正常中文对话
  • Open WebUI能识别上传图片
  • 知识库使用bge-m3
  • Draw Things能生成1024×1024图片
  • 释放Ollama后,Wan 2.2能生成480P短视频

目前先保持Ollama只监听127.0.0.1,不要把11434端口直接暴露到局域网或公网,因为Ollama接口本身没有用户登录保护。