对话补全(OpenAI 兼容)
POST /v1/chat/completions
统一 OpenAI 兼容入口。通过 model 选择上游,例如:
claude-5.5-sonnet/claude-fable-5.1/claude-3-7-sonnet→ Anthropicgpt-5.6/gpt-6-astra→ OpenAIgemini-3.8-pro/gemini-3.8-flash→ Google Gemini- 其他模型见
GET /v1/models
请求体参数 (Body)
boolean
是否开启思考模式(本仓库扩展)。仅布尔值 true 生效;与 extra_body.enable_thinking 二选一即可。
object
对话扩展参数。常用:enable_thinking;部分 Gemini 模型可用 google.thinking_config 等。是否生效取决于渠道与模型。
number
频率惩罚,约 -2~2。正值降低重复相同词句的概率。
object
按 token ID 调整出现概率,取值为 -100~100 的映射对象。
integer
补全 token 上限(o 系、GPT-5 等推理模型更常用)。未设置时可能沿用 max_tokens。
integer
本次回复最多生成的 token 数(常用字段)。
array
required
对话消息列表,至少一条。支持多轮:system / user / assistant / tool。
string
required
要使用的模型 ID。网关会按令牌分组选择渠道,并可能做模型名映射或后缀解析(如 -thinking、-search)。
integer
对同一轮输入生成几条 assistant 回复候选。
boolean
是否允许在一次回复中并行发起多个工具调用(上游支持时)。
number
存在惩罚,约 -2~2。正值减少重复已出现过的主题表述。
string
推理模型力度(如 low / medium / high)。也可通过模型名后缀由网关自动注入。
object
number
随机种子,在相同参数下尽量得到可复现结果(不保证完全一致)。注意字段名为 seed。
any
遇到这些字符串时停止生成。可为单个字符串或字符串数组(最多 4 个)。
boolean
是否流式输出。false:一次返回完整 JSON;true:SSE 增量推送,结束为 data: [DONE]。
object
number
采样温度,通常 0~2。值越高回复越随机,越低越稳定。与 top_p 一般只调一个。
any
控制是否调用工具:none(不调用)、auto(自动)、required(必须调用),或指定某个函数。
array
模型可调用的工具(函数)列表,用于对话中的 function calling。
number
核采样,0~1。只从累计概率达到 top_p 的 token 中采样。
string
终端用户唯一标识,便于平台侧滥用检测与统计。
object