创建对话请求(Anthropic)
Token Hubs 兼容 Claude 官方 POST /v1/messages 规范,已接入 Claude 生态的团队只需将 base_url 与 api_key 切换到本平台即可复用现有代码,并支持流式响应、工具调用与多模态。
请求
Endpoint
POST https://api.token-hubs.com/v1/messages
Headers
Bearer Token,格式:Bearer YOUR_API_KEY
请求体格式,固定为 application/json
API 版本号,例如:2023-06-01
请求示例
claude-opus-4-8 仅支持自适应思考(
thinking={"type": "adaptive"}),并通过output_config.effort(low/medium/high/xhigh/max)控制思考与输出的投入程度;temperature、top_p、top_k及固定思考预算budget_tokens已不再支持。
Request Body
参数按用途分组展示,常用参数默认展开,进阶参数收纳在底部折叠区,按需点开即可。
核心参数
本次调用使用的模型 ID,例如:claude-opus-4-8 等;也支持传入字符串形式的自定义/未来模型名。
输入对话消息列表(最多 100,000 条)。Claude 以「用户 / 助手」交替轮次进行对话:
在模型停止前最多生成的 token 数(最小值 ≥ 1)。模型可能会在达到上限前自然结束;不同模型支持的最大值不同,请参考模型文档。
系统提示词,用于为 Claude 提供统一的角色设定与行为准则(如「你是一名资深 Python 开发助手」等)。可以是简单字符串,也可以是文本块数组。
思考与输出控制
扩展思考配置。claude-opus-4-8 仅支持「自适应思考」,由模型自行决定何时思考、思考多深:
输出与思考投入程度的配置。
工具调用
控制模型如何使用提供的工具:
定义模型可以使用的工具列表(客户端工具或服务端工具):
流式输出
是否以 Server-Sent Events 形式增量流式返回结果,默认 false。设为 true 时按 SSE 逐块返回;大 max_tokens 请求建议开启流式以避免请求超时。
高级参数(点击展开)
自定义停止序列列表。模型生成内容遇到任一序列会立即停止,此时响应的 stop_reason 为 "stop_sequence",同时 stop_sequence 字段会返回命中的具体序列。
控制本次请求使用的服务层级:
描述本次请求的元数据对象,便于你在业务侧做审计、统计、追踪等。
终端用户的标识(例如经哈希后的用户 ID),用于安全审计和用量分析。
Response Body
对象的唯一标识符。ID 的格式和长度可能会随着时间变化。
模型生成的内容,为一组内容块数组,每个块有一个 type 决定结构。示例:
[{"type": "text", "text": "Hi, I'm Claude."}]实际用于完成本次补全的模型 ID,例如 claude-opus-4-8 等,也可为字符串。
生成消息的会话角色。对于 Claude Messages 响应,该字段始终为 "assistant"。
本次生成停止的原因,可能值:
如果触发了自定义停止序列,则为实际命中的那条 stop 序列;否则为 null。
对象类型。对于 Messages 响应,该字段始终为 "message"。
计费与速率限制相关的 token 用量统计。

