API 连接
SillyTavern 可连接多种大语言模型 API。 以下是对各类 API 的优缺点与适用场景的介绍。
通俗解释:聊天补全 vs 文本补全
首次进入 ST 的「API 连接」页面时,你会看到一个下拉选项,可在「聊天补全」和「文本补全」等选项之间切换。理解这两者的区别很有帮助。
常见误解:很多人会认为「文本补全」对应本地模型、「聊天补全」对应云端 LLM,但实际上并非如此。同样地,「NovelAI」或「Kobold」也不是完全独立的模型类型,尽管它们在 ST 的 API 下拉菜单中是单独的选项。通过适当的后端配置,可以强制模型使用不同的 API 结构,但这不是本节的重点。
当你用 ST 发送消息时,聊天内容、角色描述以及知识书、作者注释等其他提示词会被组合成一个「提示词」发送给模型。你所使用的模型的 API「类型」决定了这个提示词的具体构建方式(ST 会在后台自动处理——你可以打开 ST 终端查看发送给 AI 的完整提示词内容)。
聊天补全
顾名思义,聊天补全模型会将提示词构建为用户(你)与助手(AI)或系统(中立)之间的一系列消息。针对聊天补全训练的模型有助于营造「聊天」的感觉,让 AI「回应」最后一条消息。当你使用 ChatGPT 网站时,背后用的就是聊天补全 API。
文本补全(又称「补全」)
文本补全则是将提示词转换为一个长字符串,模型只是尝试续写这段文字(可以想象成:你的所有文字、数百条消息、所有格式和换行符等,全部被压缩成一个超长的句子)。
如果你在 ST 中的消息恰好以「YourPersona:」和「Character:」的格式交替排列,文本补全模型会尝试延续这一模式,ST 会将其渲染为新的聊天消息——但实际上模型只是在续写文本。比如输入「太阳从」,文本补全模型很可能续写为「东方升起」。
大多数文本补全模型都有推荐的「Instruct 模板」(通常在模型文档或下载页面中注明),帮助模型像聊天补全模型那样「回应」消息和指令。ST 通常在「高级格式设置」页面中提供了大多数(甚至全部)的 Instruct 模板供选择。
本地 API
- 这些 LLM API 可以在你的电脑上运行。
- 免费使用,无内容过滤。
- 安装过程可能较为复杂(SillyTavern 开发团队不提供此方面的支持)。
- 需要从 HuggingFace 单独下载 LLM 模型,每个模型大小为 5~50GB 不等。
- 大多数模型的能力不及云端 LLM API。
KoboldCpp
- 易用的 API,支持 CPU 卸载(对显存不足的用户很有帮助)和流式传输
- 在 Windows、Mac 和 Linux 上可以从单个二进制文件运行
- 支持 GGUF 模型
- 速度慢于 AutoGPTQ、Exllama/v2 等纯 GPU 加载器
- GitHub,配置说明
llama.cpp
- KoboldCpp 和 Ollama 的原始上游项目
- 提供预编译二进制文件及从源码编译的选项
- 支持 GGUF 模型
- 轻量级 CLI 接口 llama-server
- GitHub
Ollama
Oobabooga TextGeneration WebUI
- 带流式传输的一体化 Gradio UI
- 对量化模型(AWQ、Exl2、GGML、GGUF、GPTQ)和 FP16 模型的支持最为全面
- 提供一键安装程序
- 定期更新,偶尔可能与 SillyTavern 存在兼容性问题
- GitHub
将 SillyTavern 连接到 Ooba 新版 OpenAI API 的正确方式:
- 确保使用的是 2023 年 11 月 14 日之后的 Oobabooga TextGen 最新版本。
- 编辑 CMD_FLAGS.txt 文件,添加
--api标志,然后重启 Ooba 服务器。 - 将 ST 连接到
http://localhost:5000/(默认地址),无需勾选「Legacy API」选项。可删除 Ooba 控制台提供的 URL 中的/v1后缀。
可以使用 --api-port 5001 标志修改 API 监听端口,其中 5001 为自定义端口号。
TabbyAPI
- 基于 Exllamav2 的轻量级 API,支持流式传输
- 支持 Exl2、GPTQ 和 FP16 模型
- 官方扩展支持直接从 SillyTavern 加载/卸载模型
- 不推荐显存不足的用户使用(无 CPU 卸载)
- GitHub,配置说明
KoboldAI Classic(已弃用,已停止维护)
- 在本地运行,完全私密,可用模型种类丰富
- 对 AI 生成参数的控制最为直接
- 需要 GPU 提供大量显存(6~24GB,具体取决于 LLM 模型)
- 模型上下文限制为 2k
- 不支持流式传输
- 常见 KoboldAI 版本:
云端 LLM API
- 这些 LLM API 以云服务方式运行,无需占用本地资源
- 能力通常强于大多数本地 LLM
- 但都有不同程度的内容过滤,大多数需要付费
AI Horde
- SillyTavern 开箱即用,无需额外配置即可访问
- 使用个人志愿者(Horde Worker)的 GPU 处理聊天请求
- 生成等待时间、AI 参数和可用模型均取决于 Worker 的配置
- 官网,配置说明
OpenAI (ChatGPT)
Claude(Anthropic 出品)
Google AI Studio 和 Vertex AI
Mistral(Mistral AI 出品)
- 提供各种规模和用途的高效模型,可在其平台创建账号和 API 密钥。
- 通用用途上下文长度为 32k128k,代码用途为 32k256k。
- 提供有速率限制的免费层。
- 内容审核较宽松,Mistral 的核心理念是保持中立、赋能用户,详情见此处。
- 官网,配置说明
OpenRouter
DeepSeek
- 提供访问热门 DeepSeek V3(
deepseek-chat)和 DeepSeek R1(deepseek-reasoner)最新版本的能力 - 需要购买积分(最低 2 美元),但模型质价比相当高
- API 层面无内容审核,但模型可能会拒绝某些提示词
- 官网,配置说明
AI21
Cohere
Perplexity
Mancer AI
- 托管多个系列无约束模型的服务
- 使用「积分」为各模型的 token 付费
- 默认不记录提示词,但可以开启以换取 token 积分折扣
- 使用类似
Oobabooga TextGeneration WebUI的 API,详见 Mancer 文档 - 官网,配置说明
DreamGen
- 专为可控创意写作调优的无审查模型
- 提供每月免费积分及付费订阅
- 模型规模从 7B 到 70B
- 配置说明
Pollinations
- 无需配置,开箱即用
- 免费提供多种模型的访问
- 输出内容偶尔可能包含带第三方服务链接的广告