最近 24 小时请求
按推理强度的延迟
p50 / p90 · 样本数客户端鉴权
—密钥列表
默认策略
修改即保存用模型名指定推理强度
客户端可直接在模型名后加后缀选择强度(优先级最高):gpt-6-astra-low、gpt-6-astra-medium、gpt-6-astra-high、gpt-6-astra-xhigh,也支持 :xhigh 写法。未知模型名(claude-*、gpt-4o …)都会映射到默认模型;模型名含 haiku / mini / nano / small 时使用「小模型强度」,适合 Claude Code 的后台小任务。Responses 的 reasoning.effort、Chat 的 reasoning_effort、Anthropic 的 thinking.budget_tokens 同样会被识别。
会话映射
实时事件流 0 条
请求日志
发起试跑
提交后自动轮询进度,可随时中止系统提示(可选)
结果
等待0.0 s
服务设置
健康自检
检查 Prism 可达性与维护状态、每个账号的登录与沙箱状态。不消耗模型额度。
服务日志
读取服务进程日志尾部(默认 200 行),用于排查登录、沙箱、协议转换问题。
数据维护
清空面板里的测试数据,从零开始记录。不会删除账号、API 密钥或任何登录凭证。
选择密钥生成配置
能力说明
支持
- OpenAI Responses、Anthropic Messages、Chat Completions 三种协议,流式与非流式。
- 完整上下文:服务端有状态会话 + 前缀匹配复用,第二轮起只发增量(表现为缓存命中)。
- 工具调用往返(function / custom 工具,Anthropic tool_use,Codex 的 exec / apply_patch)。
- 推理强度 low / medium / high / xhigh,可用模型名后缀或各协议自带字段指定;输出推理摘要事件。
- 上下文窗口约 258k token,
cached_tokens上报。 - 联网搜索:客户端声明 web_search 工具时放开模型内置搜索,回答带来源链接。
- 图片输入(
vision_mode = inline):压缩后随提示词传给模型,由沙箱解码并看图。
限制
- 没有 token 级真流式:文本在一轮结束后按段吐出,中途以 keepalive / 推理摘要维持连接。
- 图片每张约消耗 1–3 万 token(base64 内联),不需要时可在设置里改为
placeholder。 max_output_tokens为软限制,模型可能略超。- 单轮延迟从数十秒到数分钟属正常(xhigh 更久),客户端请放宽空闲超时。
- 受 Prism 官方可用性影响;维护期间请求会失败,总览会有横幅提示。