My 桌面助手

基于 Rust + GPUI 构建的全能本地 AI 助手 · 多模型 · 多智能体 · 安全可控

最新版本 v— 🧩 新增插件系统

软件概述

My 桌面助手是一款用 Rust 语言开发、采用 GPUI 框架渲染界面的本地 AI 助手软件。它将智能对话、智能体编排、多渠道接入、本地代理、桌面宠物等能力整合在同一个客户端中, 数据完全保留在本地,兼顾性能与隐私安全。软件同时提供图形界面(my)与命令行工具(mycode),覆盖日常办公、开发辅助与自动化场景。

v1.1.0 起引入插件系统:语音合成、语音识别、本地大模型、OCR 等能力以插件形式按需安装,详见插件中心

核心功能

💬

智能对话

支持 Markdown 渲染、内嵌浏览器、桌面截图,对话持久化保存,会话窗口独立管理。

🤖

智能体与多智能体协作

Agent 工具执行、Swarm 多智能体编排,含循环检测、护栏、子代理限流、任务总结等中间件。

🔌

MCP 协议

完整支持 Model Context Protocol 客户端与服务端,可挂载外部工具与资源。

🧠

记忆系统

自动抽取、整合、检索长期记忆,支持记忆漂移检测与会话上下文关联。

技能系统

内置技能与外部技能包加载,支持文件变更、参数校验与安全沙盒执行。

📡

多渠道接入

钉钉、飞书、QQ、微信渠道集成,支持消息监听与自动回复。

🖥️

电脑操作

Computer Use 能力,含执行器、守门员、权限控制,安全地操作桌面应用。

🌐

本地代理服务器

内置代理服务,支持鉴权、限流、模型路由、日志统计与智能体增强。

🐾

桌面宠物

原生宠物窗口,支持动画、交互、对话桥接,可一键开关。

🗂️

任务与 API 管理

任务流水线调度、API 密钥管理,可视化查看执行进度。

🔒

沙盒与钩子

执行策略、路径策略沙盒隔离,会话/消息钩子灵活扩展业务流。

⌨️

多模型 & 命令行

支持 DeepSeek、Ollama、智谱、OpenRouter、LMStudio、ModelScope 等多种模型,并提供 mycode CLI。

软件架构

┌──────────────────────────────────────────────────────────────┐ │ GPUI 图形界面 (my) │ │ 聊天面板 智能体 Swarm 技能 记忆 渠道 任务 设置 宠物 │ └──────┬───────────────────────────────────────────────┬───────┘ │ │ ▼ ▼ ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ │ chat_core │ │ agent │ │ swarm │ │ mcp │ │ 对话核心 │ │ 工具执行 │ │ 多智能体 │ │ 协议支持 │ └──────┬───────┘ └──────┬───────┘ └──────┬───────┘ └──────┬───────┘ │ │ │ │ ▼ ▼ ▼ ▼ ┌──────────────────────────────────────────────────────────────────┐ │ providers: DeepSeek / Ollama / 智谱 / OpenRouter ... │ └──────────────────────────────────────────────────────────────────┘ │ │ │ │ ▼ ▼ ▼ ▼ ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ │ channel │ │ proxy │ │ sandbox │ │ memory │ │ 钉钉/飞书/QQ │ │ 本地代理 │ │ 沙盒隔离 │ │ 记忆系统 │ └──────────────┘ └──────────────┘ └──────────────┘ └──────────────┘

版本信息与下载

正在获取版本信息...

最新版本:

更新说明
下载方式

方式一:通过百度网盘下载 Windows 安装包

方式二:客户端在「设置 → 关于 → 检查更新」可自动获取新版本提示,点击通知中的链接会跳转到本页面。

产品特性

  • 完全本地化部署,数据不出设备,隐私安全可控
  • Rust + GPUI 原生编译,低资源占用、高性能渲染
  • 多模型供应商统一接入,按需切换
  • 内置沙盒执行策略与权限守门员,安全运行外部工具
  • 系统托盘常驻,支持快捷截图、宠物开关、窗口显隐
  • 紧凑模式自适应窗口尺寸,桌面空间友好
  • 图形界面与命令行(mycode)双形态,满足不同场景
  • 内置更新检查,自动拉取版本信息并提示
插件列表

插件系统总览

v1.1.0 起,My 桌面助手引入插件系统:语音合成、本地大模型、多模态理解、语音识别、文字识别、关键词唤醒等能力均以插件形式提供, 解压到主程序目录下的 Plugin/ 文件夹即可使用,即插即用、按需安装。

  • 全部插件为纯 Rust 实现的可执行程序或模型包,无需 Python 环境
  • 通过 stdio 子进程 + JSON-RPC 2.0(每行一个 JSON 消息)与主程序通信
  • 完全本地离线运行,数据不出设备
  • 主程序按需拉起子进程,stderr 自动记录到临时日志,便于排查
🗣️

Kokoro TTS 语音合成

本地文本转语音,输出 24kHz WAV,多款预置音色。

模型内置 · 轻量级 · ONNX Runtime
查看详情 →
🧠

MiniCPM5-1B 本地大模型

端侧本地 LLM,CPU 推理,支持 Function Calling 与流式输出。

权重 ≈ 2.1GB · 内存建议 ≥ 4GB
查看详情 →
👁️

MiniCPM-V 4.6 多模态

视觉语言模型,图文混合对话,看图说话完全离线。

权重 ≈ 2.6GB · 内存建议 ≥ 8GB
查看详情 →
🎙️

MyASR 语音识别

SenseVoice 中文语音转文字,多语言支持,自带端点检测。

模型 ≈ 237MB · 轻量级 · sherpa-onnx
查看详情 →
🔍

MyOCR 文字识别

PP-OCRv6 图片文字识别,检测 + 识别一体化,返回坐标与置信度。

轻量级 · MNN 引擎 · 无外部动态库
查看详情 →
🔔

Voice 语音输入模型包

关键词唤醒(默认「小助手」)+ Silero VAD 端点检测模型包。

纯模型包 · 无独立程序 · 主程序直接加载
查看详情 →
🗣️

Kokoro TTS 语音合成插件

TTS完全离线ONNX Runtime

基于 Kokoro 的纯 Rust 本地语音合成插件,通过 stdio 子进程 + JSON-RPC 2.0 与主程序通信,将文本合成为完全离线的 WAV 语音。

Kokoro TTS 插件界面预览
Kokoro TTS 插件界面预览
  • 完全本地离线合成,数据不出设备
  • 输出 16-bit PCM 24000Hz 单声道 WAV,可直接播放
  • 内置多款预置中英文音色(zm_009、zf_001 等),支持语速调节
  • 隐藏 CMD 窗口运行,stderr 自动记录日志便于排查
📦 模型:tts_small(已内置) 🖥️ Windows 🎛️ 音色 / 语速可调

方法说明
ping心跳检测,返回模型名与版本
synth合成语音,参数:textvoicespeedoutput_dir,返回 WAV 文件路径、采样率与耗时
list_voices列出所有预置音色名
{"jsonrpc":"2.0","id":1,"method":"synth","params":{"text":"你好","voice":"zm_009","speed":1.0,"output_dir":"C:/tmp"}} → {"jsonrpc":"2.0","id":1,"result":{"audio_path":"C:/tmp/tts_....wav","sample_rate":24000,"duration_secs":1.52,"synth_time_secs":0.83}}

# CLI 一次性合成,输出 WAV kokoro-tts-rs.exe chat --text "你好,欢迎使用" --voice zm_009 --speed 1.0 --output ./output.wav # stdio JSON-RPC 服务模式(主程序自动调用) kokoro-tts-rs.exe serve --model-dir ./models/tts_small

环境变量说明
KOKORO_TTS_PATH指定 kokoro-tts-rs.exe 完整路径
KOKORO_TTS_MODEL_DIR指定模型目录(需含 tts_small.onnx / tts_small.bin)
ORT_DYLIB_PATH指定 onnxruntime.dll 完整路径

Kokoro TTS 小模型权重(tts_small.onnx / tts_small.bin),可参考 hexgrad/kokoro 官方仓库获取原始权重并转换。
🧠

MiniCPM5-1B 本地大模型插件

LLM1B 端侧candleCPU 推理

纯 Rust 实现的 MiniCPM5-1B 端侧大模型推理引擎,基于 candle 框架,作为完全离线的本地 LLM 后端,无需 Python 环境、无需 GPU。

MiniCPM5-1B 插件界面预览
MiniCPM5-1B 本地大模型插件界面预览
  • 纯 CPU 推理,开箱即用
  • 兼容 OpenAI Function Calling,模型可输出 tool_calls,配合智能体工具执行
  • 支持流式输出与思考模式(thinking)
  • 磁盘 KV 缓存:多轮对话稳定前缀命中后仅 prefill 新增 token,首 token 延迟显著降低,LRU 自动淘汰
  • 请求级超时与卡死自动重启机制
📦 权重 ≈ 2.1GB 🧮 内存建议 ≥ 4GB 🖥️ Windows

方法说明
ping心跳检测
chat对话推理,params 与 OpenAI Chat 格式一致,支持 messages、tools、max_tokens、temperature、thinking、stream
{"jsonrpc":"2.0","id":1,"method":"chat","params":{ "messages":[{"role":"user","content":"你好"}], "max_tokens":256, "temperature":0.0, "thinking":false, "stream":true}} → {"id":1,"delta":{"content":"你"}} ... {"id":1,"done":true,"usage":{...}}

# CLI 一次性问答 minicpm5-rs.exe chat --prompt "你好,介绍一下自己" --max-tokens 256 # stdio JSON-RPC 服务模式(主程序自动调用) minicpm5-rs.exe serve --model-dir ./models/OpenBMB/MiniCPM5-1B

环境变量说明
MINICPM5_RS_PATH指定 minicpm5-rs.exe 完整路径
MINICPM5_DEVICE强制推理设备:cpu / gpu(默认自动检测)

模型权重从魔搭社区 ModelScope下载, 使用遵循 OpenBMB MiniCPM 许可协议。
👁️

MiniCPM-V 4.6 多模态插件

VLM多模态图文理解candle

纯 Rust 实现的 MiniCPM-V 4.6 多模态视觉语言模型,架构为 SigLIP2-400M(视觉编码器)+ Perceiver Resampler(投影器)+ Qwen3.5-0.8B(LLM 骨干),实现完全离线的图文理解。

MiniCPM-V 4.6 多模态插件界面预览
MiniCPM-V 4.6 多模态插件界面预览
  • 图文混合对话,图片经 base64 内嵌直传,看图说话
  • 纯文本 / 图文双模式,均支持流式输出
  • 纯 CPU 推理,支持 Intel MKL 加速编译
  • 请求级超时(600s)与卡死自动重启
📦 权重 ≈ 2.6GB 🧮 内存建议 ≥ 8GB 🖥️ Windows

方法说明
ping心跳检测
chat纯文本对话推理,支持流式 / 非流式
chat_with_image图文推理,params 中携带 base64 图片
{"jsonrpc":"2.0","id":2,"method":"chat_with_image","params":{ "messages":[{"role":"user","content":"图片里是什么?"}], "image_base64":"", "max_tokens":256}}

# 纯文本问答 minicpmv-rs.exe chat --prompt "你好,请介绍一下你自己" # 单图问答 minicpmv-rs.exe image-chat --prompt "图片里是什么?" --image test.jpg # stdio JSON-RPC 服务模式(主程序自动调用) minicpmv-rs.exe serve --model-dir ./models/OpenBMB/MiniCPM-V-4.6

环境变量说明
MINICPMV_RS_PATH指定 minicpmv-rs.exe 完整路径
MINICPMV_DOWNSAMPLE_MODE下采样模式:4x 或 16x(默认 4x)

模型权重从魔搭社区 ModelScopeHuggingFace下载,遵循 Apache 2.0 许可。
🎙️

MyASR 本地语音识别插件

ASRSenseVoicesherpa-onnx

基于 sherpa-onnx 的 SenseVoice 中文语音识别本地插件,实现完全离线的语音转文字。

MyASR 语音识别插件界面预览
MyASR 语音识别插件界面预览
  • SenseVoice int8 量化模型(约 237MB),体积小、识别快
  • 内置 Silero VAD 端点检测,自动分段
  • 支持 auto / zh / en / ja / ko / yue 多语言
  • 支持 WAV / MP3 / OGG / FLAC 输入(symphonia 解码)
  • use_itn 逆文本正则化,自动还原数字与标点
📦 模型 ≈ 237MB 🌐 多语言 🖥️ Windows

方法说明
ping心跳检测,返回模型名(sensevoice)与版本
transcribe语音转写,参数:audio_path、language、use_itn,返回全文与分段结果
list_models列出可用模型
{"jsonrpc":"2.0","id":1,"method":"transcribe","params":{"audio_path":"C:/tmp/rec.wav","language":"auto","use_itn":true}} → {"jsonrpc":"2.0","id":1,"result":{"text":"今天天气怎么样","segments":[...],"duration_secs":1.5,"transcribe_time_secs":0.4}}

# CLI 一次性识别,输出文本 my-asr-rs.exe chat --audio ./test.wav --language zh # stdio JSON-RPC 服务模式(主程序自动调用) my-asr-rs.exe serve --model-dir ./model

环境变量说明
MY_ASR_PATH指定 my-asr-rs.exe 完整路径
MY_ASR_MODEL_DIR指定模型目录(需含 model.int8.onnx / tokens.txt)
ORT_DYLIB_PATH指定 onnxruntime.dll 完整路径

SenseVoice 模型与 Silero VAD 模型可从 sherpa-onnx 官方模型列表下载,模型遵循各自的开源许可。
🔍

MyOCR 本地文字识别插件

OCRPP-OCRv6MNN

基于 PaddleOCR PP-OCRv6 的本地 OCR 插件,推理引擎使用 MNN(静态链接进 exe),实现完全离线的图片文字识别。

MyOCR 文字识别插件界面预览
MyOCR 文字识别插件界面预览
  • 检测 + 识别一体化,返回文本框坐标与置信度
  • detect / recognize 可独立调用(仅检测框 / 整图识别)
  • 无外部动态库依赖(MNN 静态链接)
  • 支持 JPG / PNG / BMP / WebP 等常见图片格式
📦 模型内置 📍 坐标 + 置信度 🖥️ Windows

方法说明
ping心跳检测,返回模型名(pp-ocrv6-medium)与版本
ocr检测 + 识别一体化,返回文本块列表(文本 / 置信度 / 四点坐标)与耗时
detect仅文本检测,返回检测框四点坐标
recognize仅文本识别(整图),返回文本与置信度
list_models列出可用模型
{"jsonrpc":"2.0","id":1,"method":"ocr","params":{"image_path":"C:/tmp/test.png"}} → {"jsonrpc":"2.0","id":1,"result":{"text_blocks":[{"text":"你好世界","confidence":0.97,"box_points":[...]}],"elapsed_ms":180}}

# CLI 一次性 OCR,逐行输出识别文本 my-ocr-rs.exe chat --image ./test.png # stdio JSON-RPC 服务模式(主程序自动调用) my-ocr-rs.exe serve --model-dir ./model

环境变量说明
MY_OCR_PATH指定 my-ocr-rs.exe 完整路径
MY_OCR_MODEL_DIR指定模型目录

PP-OCRv6 medium 模型与字符集源自 PaddleOCR 官方发布,遵循 Apache 2.0 许可。
🔔

Voice 语音输入模型包

KWSVAD关键词唤醒

语音输入功能所需的本地模型包(无独立可执行程序),由主程序通过 sherpa-onnx 直接加载,用于关键词唤醒(KWS)与语音端点检测(VAD)。

  • Zipformer 中文关键词唤醒(zh-en-3M 流式模型),默认唤醒词「小助手」
  • Silero VAD 识别说话起止,确定命令录音边界
  • 唤醒词可配置,keywords.txt 自动重生成(汉字 → 带调拼音 → ppinyin token)
  • 模型文件通配匹配加载,不硬编码版本号
📦 纯模型包 🎚️ 唤醒词可配置 🖥️ 主程序直接加载

voice: wake_word: enabled: false engine: sherpa_kws model: Plugin/voice/kws # KWS 模型目录 phrase: 小助手 # 唤醒词短语 threshold: 0.35 # 命中阈值 cooldown_ms: 1500

voice/ ├── silero_vad.onnx # Silero VAD 语音活动检测模型 └── kws/ # Zipformer 中文关键词唤醒模型 ├── encoder-*.int8.onnx # 编码器(int8 量化) ├── decoder-*.onnx # 解码器 ├── joiner-*.int8.onnx # Joiner(int8 量化) ├── tokens.txt # BPE 词表 └── keywords.txt # 关键词列表(自动生成)

Silero VAD 来自 silero-vad 官方 ONNX 导出; KWS Zipformer 来自 sherpa-onnx 的 sherpa-onnx-kws-zipformer-zh-en-3M 预训练模型,遵循各自的开源许可。

插件下载

插件为 RAR 压缩包,下载后解压到主程序安装目录下的 Plugin/ 文件夹(保持压缩包内的目录名不变),重启 My 桌面助手即可使用。 可按需单独下载,其中大模型插件(MiniCPM5 / MiniCPM-V)体积较大,请确认磁盘空间与内存满足要求。

压缩包列表
🗣️ kokoro-tts.rar · 语音合成 🧠 minicpm5.rar · 本地大模型(约 2.1GB) 👁️ minicpmv.rar · 多模态(约 2.6GB) 🎙️ my-asr.rar · 语音识别 🔍 my-ocr.rar · 文字识别 🔔 voice.rar · 唤醒词 + VAD