Parlor 快速入门
Parlor 是一款完全在你设备上运行的实时多模态 AI 助手。不依赖云端服务器,所有推理在本地完成——你可以用自然语音与它对话,同时它还能”看到”你屏幕或摄像头中的画面。Parlor 由 Google 的 Gemma 4 E2B 模型提供多模态理解能力,Kokoro TTS 引擎负责语音合成,基于 Apple 的 MLX 框架在 Apple Silicon(M 系列芯片)上实现原生优化。
这款工具的出现标志着 AI 发展的一个重要趋势:推理不再必须依赖云端。对于隐私敏感的场景——医疗咨询、法律文件审查、企业内部数据查询——Parlor 提供了完全无需将数据发送到第三方的选择。开源许可证(Apache-2.0)意味着你可以自由定制它的行为:调整语音参数、更换底层模型,甚至嵌入自己的应用。
⚠️ 研究预览阶段:Parlor 目前处于早期实验阶段,开发者明确标注”Expect rough edges and bugs”。不建议在生产环境或关键场景中依赖。
功能特性
完全本地运行,隐私满分
Parlor 的所有推理环节——语音识别、视觉理解、文本生成、语音合成——全部在设备上完成。没有数据离开你的机器,不需要注册账号,不需要 API Key,也不消耗任何云服务配额。对于处理敏感信息的用户来说,这意味着绝对的数据主权。
具体技术栈:
- 多模态理解:Gemma 4 E2B(Google 专为设备端优化的模型)
- 语音合成(TTS):Kokoro(轻量级引擎,支持多种自然语音风格)
- 推理运行时:LiteRT-LM
- Apple Silicon 加速:MLX 框架
实时语音 + 视觉双模态
与大多数只支持文本或单模态的本地 AI 不同,Parlor 同时支持语音输入和视觉输入:
- 语音对话:用自然语音提问,AI 用语音回答。延迟在 M2+ 设备上约 500ms,接近实时对话体验
- 视觉识别:指向屏幕上的图表问”这个趋势说明了什么”,或让摄像头对准文档让它朗读。视觉理解基于 Gemma 4 E2B 的多模态能力,能识别物体、文字、图表和场景
- 多语言支持:Gemma 4 E2B 原生多语言,用户可以随时切换到母语交流
Apple Silicon 原生优化
Parlor 使用 Apple 的 MLX 框架进行推理,充分利用 M 系列芯片的统一内存架构(Unified Memory)和神经网络引擎(Neural Engine)。在 M2/M3/M4 芯片上:
- 语音响应延迟通常在 500ms 以内
- 视觉理解约 1-2 秒完成
- 内存占用约需 8-12GB(建议 16GB+)
完全开源,自由定制
Apache-2.0 许可证意味着你可以:
- 修改源代码以适应特定需求
- 替换视觉模型(例如使用其他 MLX 兼容模型)
- 调整 TTS 参数以获得不同语音风格
- 将 Parlor 嵌入到自己的工作流或应用中
硬件要求
Parlor 对硬件有明确限制,安装前请确认:
| 要求 | 说明 |
|---|---|
| 芯片 | Apple Silicon(M1/M2/M3/M4 系列),不支持 Intel Mac 或 Windows/Linux |
| 内存 | 建议 16GB 及以上(8GB 可能因内存不足无法运行) |
| 存储 | Gemma 4 E2B 和 Kokoro 模型合计约需数 GB,首次运行时自动下载 |
| 系统 | macOS(MLX 框架仅支持 Apple 平台) |
💡 不支持 Intel Mac 的原因是 MLX 框架深度依赖 Apple Silicon 的统一内存架构和 Neural Engine。Windows/Linux 用户目前无法使用 Parlor,但可关注 Moshi(仅语音)或 Open WebUI(需搭配本地 LLM)等跨平台替代方案。
安装与使用
Parlor 的安装流程简洁,三步即可启动:
# 1. 克隆仓库
git clone https://github.com/fikrikarim/parlor.git
cd parlor
# 2. 安装依赖
pip install -r requirements.txt
# 3. 启动服务
python -m parlor
首次运行时,Parlor 会自动下载所需的 Gemma 4 E2B 和 Kokoro 模型文件。下载时间取决于网络速度,通常需要 5-15 分钟。项目提供 .env.example 文件作为配置参考,你可以根据需要调整模型参数。
配置说明
通过 .env 文件可以调整以下关键参数(参考 .env.example):
- 模型路径:指定自定义模型文件位置
- TTS 语音风格:切换 Kokoro 支持的语音预设
- 日志级别:调试时建议开启 verbose 模式
使用场景
隐私敏感的专业工作
医生可以在本地查询医学文献而不泄露患者信息,律师可以分析案件文档而不将数据上传云端。Parlor 的完全本地架构意味着 HIPAA、GDPR 等合规场景下的数据处理不再需要签署复杂的第三方协议。
离线环境
在无网络的环境中——飞机、地下室、野外考察——Parlor 仍能提供完整的 AI 助手体验。所有模型文件一次性下载后永久可用。
语言学习
Parlor 的开发初衷之一就是帮助用户练习英语口语。开发者自述他正在自托管一个免费语音 AI 来帮助数百名月活用户学习英语,而设备端运行可以将服务器成本降为零。多语言模型支持让学习者在遇到困难时随时切换到母语。
AI 研究和实验
开源架构允许研究人员:
- 替换底层视觉模型以测试不同架构
- 调整推理参数研究延迟-质量 tradeoff
- 将 Parlor 作为多模态交互的参考实现
日常多模态助手
用语音提问、让 AI 识别屏幕内容、朗读文档——所有这些都在本地完成,无需担心隐私泄露。
竞品对比
与 ChatGPT Advanced Voice 对比
ChatGPT 的语音模式基于 GPT-4o 云端推理,模型能力显著更强——更自然的语音合成、更准确的多模态理解、更广的语言覆盖。但所有对话数据经过 OpenAI 服务器,需要网络连接,且有月度订阅费用(ChatGPT Plus $20/月)。
Parlor 的核心优势在于零成本、零数据外泄。如果你的场景是”偶尔需要语音助手但不希望数据离开设备”,Parlor 是更好的选择。如果需要的是”最强模型能力”,ChatGPT 更合适。
与 Apple Intelligence 对比
Apple Intelligence 是系统级 AI,深度集成在 macOS/iOS 中,使用体验最流畅。但它是闭源的,用户无法自定义模型或调整参数。Apple Intelligence 采用”本地 + Private Cloud Compute”混合架构,隐私优于纯云端但不如 100% 本地。
Parlor 的开源可定制性是其核心差异化——你可以完全掌控 AI 的行为。但 Apple Intelligence 的安装门槛为零(系统内置),Parlor 需要一定的命令行和 Python 基础。
与 Moshi(Kyutai)对比
Moshi 是法国 Kyutai 实验室开发的本地语音 AI,专注于纯语音对话。它支持更多平台(包括 CUDA),社区更活跃。但 Moshi 没有视觉多模态能力——你无法让它”看到”屏幕或摄像头内容。
Parlor 在 Moshi 的基础上增加了视觉理解,使用场景更广泛。如果你的需求是纯语音对话且需要跨平台(如 Windows/Linux),Moshi 可能更合适。
注意事项与限制
- 平台限制:仅 Apple Silicon,短期内不会支持其他平台(MLX 框架硬依赖)
- 早期阶段:明确标注”研究预览”,可能有崩溃、延迟不稳定等问题
- 模型能力边界:Gemma 4 E2B 是小型模型(为设备端优化),在复杂推理、代码生成、数学计算等任务上远不如 GPT-4o 或 Claude Opus
- 无图形界面:纯命令行操作,对非技术用户不够友好
- 单人项目:主要由一位开发者(fikrikarim)维护,社区贡献有限
📊 评分与标签
评分说明
总分 8.5/10 · P_优选
📊 可观测社区指标(数据核验日期:2026-07-07)
- GitHub: fikrikarim/parlor ★1,885(1.9k),🔱237
- 来源:GitHub API — 页面访问核验:stargazers_count=1885,forks_count=237,open_issues_count=5
- 仓库创建于 2026-04-05,已运行约 3 个月,39 次提交,2 位贡献者
- 来源:GitHub API — created_at=2026-04-05,pushed_at=2026-06-04
- GitHub Topics: apple-silicon, gemma, kokoro, litert-lm, local-llm, mlx, multimodal, on-device-ai, python, real-time, speech-recognition, text-to-speech, voice-assistant
- 许可证: Apache-2.0
⚙️ 功能完整度 2.2/2.5
- 支持语音+视觉双模态交互,覆盖麦克风语音输入、摄像头/屏幕视觉输入、文本输出和 TTS 语音合成输出,四种模态在设备端实时协同
- 来源:GitHub README — “Have natural voice and vision conversations with an AI that runs entirely on your machine”
- 技术栈清晰:Gemma 4 E2B(多模态理解)+ Kokoro(TTS)+ LiteRT-LM(推理运行时)+ MLX(Apple Silicon 优化),依赖链简洁
- 来源:GitHub README — “Parlor uses Gemma 4 E2B for understanding speech and vision, and Kokoro for text-to-speech”
- 核心限制:仅支持 Apple Silicon(M1+),无 Windows、Linux、Intel Mac 支持;无 Web/GUI 界面,纯 CLI 操作;无 API 接口
- 来源:GitHub README — 明确依赖 MLX 框架,仅 Apple Silicon 可用
- 对比 ChatGPT Advanced Voice:ChatGPT 支持更丰富的功能(多语言多口音、实时翻译、多设备同步),但依赖云端推理,需要 $20/月订阅
- 来源:ChatGPT 定价
- 对比 Moshi(Kyutai):Moshi 仅有语音对话能力(无视觉),但支持 CUDA 跨平台,Parlor 多了视觉多模态但平台受限
- 来源:Moshi GitHub
✨ 输出质量 1.9/2.5
- Gemma 4 E2B 是 Google 专为设备端优化的多模态模型,在消费级硬件上平衡推理能力与运行效率,但模型规模远小于 GPT-4o/Claude Opus 等云端旗舰,复杂推理和代码生成能力有明显差距
- 来源:GitHub README — “Powered by Gemma 4 E2B and Kokoro”
- Kokoro TTS 合成延迟在 Apple Silicon 上约 500ms 以内,接近实时对话体验,支持多种语音风格
- 来源:GitHub README — 演示视频显示实时对话流畅度
- 无公开基准测试成绩(SWE-bench、MMLU、Chatbot Arena 等均未包含 Gemma 4 E2B),无法量化评估推理/多模态绝对能力
- 来源:Chatbot Arena Leaderboard — 未收录 Gemma 4 E2B
- 开发者明确标注”Research preview — expect rough edges and bugs”,输出稳定性无法保证
- 来源:GitHub README — “This is an early experiment. Expect rough edges and bugs.”
- 对比 ChatGPT Advanced Voice:GPT-4o 的语音合成更自然流畅,多模态理解能力更强,但需要网络连接且产生数据隐私成本
- 对比 Apple Intelligence:系统级集成更流畅,语音识别准确性更高,但模型由 Apple 控制不可替换
🖐️ 易用性 1.2/1.5
- 安装流程简洁:git clone → pip install -r requirements.txt → python -m parlor,三步启动
- 来源:GitHub README — “python -m parlor”
- 首次运行自动下载所需模型,不需要手动配置模型文件路径
- 来源:GitHub README — 安装说明含自动模型下载
- 提供
.env.example配置文件模板,支持自定义模型路径和 TTS 参数- 来源:GitHub 仓库文件 — .env.example 文件
- 硬性限制:仅支持 Apple Silicon(M1+),排除所有 Intel Mac、Windows、Linux 用户;需要命令行基础和 Python 环境配置
- 来源:GitHub README — MLX 框架平台约束
- 无图形界面(GUI),无 Web 界面,无移动端 App
- 来源:GitHub 仓库 — 仓库内无 GUI 相关代码
- 对比 ChatGPT:浏览器打开即用,零安装,跨平台,无需特定硬件,支持 iOS/Android App
- 对比 Apple Intelligence:macOS/iOS 系统内置,零安装零配置,对普通用户最友好
💰 性价比 1.5/1.5
- 完全免费:Apache-2.0 开源许可证,无任何收费计划,无使用限制
- 来源:GitHub License — Apache License 2.0
- 本地推理零 API 费用:所有计算在设备端完成,无需 API Key,无用量配额,无订阅费用
- 来源:GitHub README — “runs entirely on your machine”
- 对比 ChatGPT Plus($20/月):Parlor 零持续成本,但需要 Apple Silicon 硬件(一次性投入 $1000+)
- 来源:ChatGPT 定价
- 对比 Moshi:同为免费开源项目,成本结构完全相同
- 来源:Moshi GitHub
- 对比 Apple Intelligence:免费内置在 Apple 设备中,但仅限最新系统版本
🔒 稳定性 0.7/1.0
- 2026 年 4 月 5 日创建,至今运行约 3 个月,属于非常早期的项目
- 来源:GitHub API — created_at=2026-04-05
- 共 39 次提交,最近一次更新为 2026 年 6 月(约一个月前),维护频率中等
- 来源:GitHub API — 39 commits,pushed_at=2026-06-04
- 仅 2 位贡献者,主要由 fikrikarim 维护,社区贡献有限;5 个 open issues
- 来源:GitHub 页面 — Issues 5,Contributors 2
- 开发者明确标注”研究预览”状态,提示可能存在崩溃和 bug
- 来源:GitHub README — “Research preview. Expect rough edges and bugs.”
- 对比 ChatGPT:OpenAI 商业产品,SLA 保障,全球多区域部署,稳定性远超个人开源项目
- 对比 Moshi:同为早期开源项目,但 Moshi 由 Kyutai 实验室团队维护,贡献者和社区规模更大
- 来源:Moshi GitHub
🛡️ 隐私安全 1.0/1.0
- 完全本地运行,所有推理在设备端完成——语音、图像、文本全部在本地处理,数据永不离开设备
- 来源:GitHub README — “runs entirely on your machine”
- Apache-2.0 开源许可证,代码完全可审计,任何人都可以检查是否存在后门或数据外传逻辑
- 来源:GitHub License — Apache License 2.0
- 无需注册账号、无需 API Key、无需网络连接即可使用——从根本上杜绝了数据泄露途径
- 对比 ChatGPT:所有对话数据经过 OpenAI 服务器,存在数据收集和模型训练使用的隐私风险
- 来源:OpenAI 隐私政策
- 对比 Apple Intelligence:部分本地 + 部分云端(Private Cloud Compute),隐私优于纯云端但不如 100% 本地
- 对比 Moshi:同为完全本地运行,隐私保护水平相当
- 来源:Moshi GitHub
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
🏷️ 标签说明
- 开源免费: Apache-2.0 许可证,完全免费无限制。来源:GitHub License
- 本地: 所有推理在设备端完成,无需联网无需 API Key。来源:GitHub README
- 音频: 实时语音识别+语音合成双模态交互。来源:GitHub README
- 多语言: Gemma 4 E2B 原生支持多语言输入和输出。来源:GitHub README
📋 来源与核验记录
- ✅ 已核验: GitHub API(stargazers_count=1885,forks_count=237,open_issues_count=5,license=Apache-2.0,created_at=2026-04-05,pushed_at=2026-06-04)| GitHub 页面(Stars 1.9k,Forks 237,Issues 5,39 Commits,2 Contributors,Apache-2.0)| GitHub README(Research preview 声明,Gemma 4 E2B + Kokoro 技术栈,python -m parlor 启动命令)
- ⚠️ 未验证(被拦截/需登录/无权限): 无
- ⚠️ 间接来源(二手数据): 无
- ❌ 已删除死链: 无
同分类推荐
AI音频 分类下的其他工具