这是什么
这是一个邀请制的模型推理服务,运行在单台 RTX 5090 上的
qwen3.8-27b(262K 上下文)。它提供标准的
OpenAI 兼容 API 和一个网页对话入口。
你的密钥只用于鉴权和配额计量;对话历史保存在你自己的浏览器里, 服务端不保存你的对话内容,仅记录用量元数据(时间、token 数)。
端点
Base URL: https://<域名>/v1 模型 ID: qwen3.8-27b 鉴权: Authorization: Bearer <你的邀请密钥>
客户端接入
DeepSeek Harness(dsh)
在你的 ~/.dsh/settings.yaml 中增加一个 provider 并切换默认模型:
llm-pi-ai:
providers:
dsh27b:
{
api: openai-completions,
baseURL: https://<域名>/v1,
models: [ { id: qwen3.8-27b, name: qwen3.8-27b } ],
apiKeyEnv: DSH27B_API_KEY
}
agent-default-model:
provider: dsh27b
model: qwen3.8-27b
然后在环境里设置 DSH27B_API_KEY 为你的密钥。
ChatBox
设置 → 模型 → 添加自定义模型:服务商选「OpenAI 兼容」,Base URL 填 https://<域名>/v1,模型 qwen3.8-27b,API Key 填你的密钥。
Codex CLI
export OPENAI_BASE_URL=https://<域名>/v1 export OPENAI_API_KEY=sk-dsh-...
任意 OpenAI 兼容客户端
curl https://<域名>/v1/chat/completions \
-H "Authorization: Bearer sk-dsh-..." \
-H "Content-Type: application/json" \
-d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}]}'
限制
- 单一共享 GPU:并发有限,高峰期会排队(429 + Retry-After 表示请重试)
- 每个密钥有每分钟请求数、每分钟 token 数与总配额上限
- 单次请求 prompt 超过约 48K tokens 会被拒绝
- 长时间思考的回复可能持续数分钟,请耐心等待流式输出
条款(摘要)
- 密钥仅限本人使用,禁止转售、共享或公开
- 禁止利用本服务生成违法内容或从事任何违法违规活动
- 禁止滥用算力(无意义的超长上下文刷取、攻击性使用等)
- 服务端保留用量日志(元数据)用于追溯,不保留对话内容
- 服务者可随时吊销密钥;本服务为实验性邀请制,不提供可用性承诺
- 内容由 AI 模型生成,不构成任何专业建议
完整条款在发放密钥时提供。收到密钥即视为同意。
状态
健康检查:/healthz(无需鉴权)