Skip to content

供应商与模型

日常用 Memoh,多半要配好:

  • 一个或多个 供应商(怎么连上游 API)
  • 其下的 模型
  • 若要朗读,再配 语音合成(见 TTS
  • 若要把语音转文字,再配 语音转写

聊天与 embedding 在 Models 页管理;语音合成模型在 TTS 流程里单走,语音转写模型在 Transcription 设置页管理。


供应商基础

供应商里存的是某一类上游的连法,例如:

  • 协议(client_type
  • 需要时的 base URL
  • API Key 或 OAuth 等凭据

常见有 OpenAI 兼容站、Anthropic、Google、Codex、GitHub Copilot 等。

新建供应商

供应商现在从模板目录建。模板自带对的 client type、base URL 和一份精选模型清单,通常你只需要填个 API Key。

  1. 侧栏打开 Models
  2. Add Provider,从模板列表挑——只显示你还没配过的,可搜索(中文厂商名也能搜到)。
  3. 填模板要的凭据。
  4. 保存。供应商和它的预置模型在保存时一起生成。

内置模板包括 OpenAI、Anthropic、Google、OpenRouter、DeepSeek、智谱 AI(bigmodel.cn)、Z.AI、Azure OpenAI、Cerebras、Cloudflare、Fireworks、Perplexity、Together 等。注意智谱 AIopen.bigmodel.cn,国内账号)和 Z.AIapi.z.ai,国际账号)是两个模板、两套 key 体系——按你的 key 是哪边发的来选。

没有合适模板时,仍可以建全自定义供应商。

常用字段:

字段说明
Name展示名,如 OpenAI
Client Type本供应商用的协议。
Base URL部分协议必填的根地址。
API Key走密钥时填。

客户端类型

Client Type常见用途
openai-responsesOpenAI Responses 风格
openai-completionsChat Completions 兼容
anthropic-messagesAnthropic Messages
google-generative-aiGoogle Gemini
openai-codexCodex / ChatGPT 那套,OAuth
github-copilotCopilot,设备码 OAuth
edge-speechEdge 朗读
openai-speechOpenAI 兼容语音合成
openai-transcriptionOpenAI 兼容语音转写
openrouter-speechOpenRouter 语音合成
openrouter-transcriptionOpenRouter 语音转写
elevenlabs-speechElevenLabs 语音合成
elevenlabs-transcriptionElevenLabs 语音转写
deepgram-speechDeepgram 语音合成
deepgram-transcriptionDeepgram 语音转写
minimax-speechMiniMax 语音合成
volcengine-speech火山引擎语音合成
alibabacloud-speech阿里云语音合成
microsoft-speechMicrosoft 语音合成
google-transcriptionGoogle 语音转写

语音合成与语音转写类型不能当主聊天用。语音合成走 TTS 提供方,语音转写走 Transcription 设置页。具体模型、音色和语言取决于 provider 模板与上游账号。


走 OAuth 的供应商

多数类型用普通 API Key。openai-codexgithub-copilot 例外——两个都走设备码授权,同一套流程,都没有 API Key 输入框:

  1. 先建好并保存供应商——授权入口只在已保存供应商的详情面板里。
  2. Account 区点 Connect,界面给出验证 URL、一次性用户码和过期倒计时。
  3. Copy & Open,去验证页输码,Memoh 自动完成收尾。

一次性码只在显示的官方验证 URL 上输——设备码可能被用于钓鱼。

连上后供应商上会显示当前账号,Revoke 断开。

OpenAI Codex

  • 类型 openai-codex,模板指向 https://chatgpt.com/backend-api
  • 用 ChatGPT 账号登录

偏写代码、走 Codex 那套时合适。

GitHub Copilot

  • 类型 github-copilot
  • 用 GitHub 账号登录

你本来就有 Copilot 时,可复用进 Memoh。

升级提醒

Copilot 凭据以前按用户存,现在和 Codex 一样是供应商级的一份。老部署升级后要把 Copilot 供应商重新授权一次

托管模型目录

两个 OAuth 供应商的模型列表都是托管目录,从上游实时拉取(Codex 干脆没有静态清单,永远反映你 ChatGPT 账号实际能用什么):

  • 设备授权完成后目录自动同步,之后也可以随时重新导入。
  • 上游目录里消失的模型标记为不可用,不会被删。
  • 重复导入是增量合并:补上新发现的能力,不覆盖你自己的模型配置。

导入模型

建完供应商后可以导入或手加模型。常见:选中供应商 → Import Models(若上游有目录)→ 勾要保存的。已知上游 id 时也可手填。

模型启用开关

供应商详情页里每个模型一行,各带启用开关。禁用的模型仍留在这页方便再开,但会从所有模型选择器(机器人设置、聊天、embedding 等)里消失。

默认值看模型怎么来的:

  • 手动添加的模型默认启用。
  • 批量导入的模型默认禁用——导一大目录不至于把每个选择器刷爆,要用哪个自己开哪个。

模型类型

类型用途
chat对话、工具、推理、文生图等
embedding向量化、记忆检索
speech朗读,挂在 TTS
transcription语音转文字,挂在 Transcription

Models 页主要管 chat / embedding;speech 在 TTS,transcription 在 Transcription 设置页。


聊天模型上要注意的项

字段说明
Model ID上游真实 id,如 gpt-4o
Name界面展示名。
Description可选说明文字,模型列表里悬停可见,选择器里还能按它搜。
Compatibilitiesvisiontool-callimage-outputreasoning
Context Window粗算上下文上限。

兼容性

标记含义
vision能吃图
tool-call能调工具
image-output能出图
reasoning有显式推理/档位

有推理时可能还带 reasoning_effortsnonelowxhigh 等。

context_window

Memoh 用来:

  • 在网页上算当前会话占了多少上下文
  • 驱动 /status
  • 判断是否逼近上限
  • 决定何时需要 会话上下文压缩

不填也能用,但百分比会没法精确给。

文生图模型

机器人上可单挂 Image Generation Model,须是带 image-output 的 chat 模型。需要时与默认聊天模型分开。


Embedding 模型

给语义索引用。必填如 Dimensions(向量维数,如 1536)。和记忆或其它向量检索能力绑在一起用。


语音合成与转写模型

语音合成在 TTS 提供方 配,不跟普通 chat 供应商混流。当前语音合成类别包括:

  • Edge:edge-speech
  • OpenAI 兼容:openai-speech
  • OpenRouter:openrouter-speech
  • ElevenLabs:elevenlabs-speech
  • Deepgram:deepgram-speech
  • MiniMax:minimax-speech
  • 火山引擎:volcengine-speech
  • 阿里云:alibabacloud-speech
  • Microsoft:microsoft-speech

语音转写在 Transcription 设置页配。当前语音转写类别包括:

  • OpenAI 兼容:openai-transcription
  • OpenRouter:openrouter-transcription
  • ElevenLabs:elevenlabs-transcription
  • Deepgram:deepgram-transcription
  • Google:google-transcription

音频模型有 provider 专属的音色、格式、语速、音高、语言和识别设置,和 chat/embedding 不是一路设置。


怎么记省事

对多数机器人,可以分几条线想:

  • Chat:日常说人话
  • Embedding:记忆
  • Speech / Transcription / 生图模型:边能力

不必强行一模型全包。


接下来

  • 给机器人绑聊天、生图、浏览器、记忆、朗读等:机器人
  • 配语音提供方与语音模型:TTS 提供方
  • 配语音转文字:打开 Web UI 的 Transcription 设置页

Published under AGPLv3