PUBLIC BETA · 边缘推理试运营

五种能力,
一个清晰端点。

无需注册或 API Key。直接试用 Kimi、GLM、GPT-OSS 与 Gemma;站内长输出统一使用 SSE,第三方应用可使用 OpenAI 双协议。

鉴权
匿名
传输
SSE
运行位置
Cloudflare Edge
CFWORKERS
AI
KIMIK2.6 KIMIK2.7 CODE GLM5.2 GPTOSS 120B GEMMA4 26B REQUESTS ROUTED AT THE EDGE

02 / MODELS

指定模型,明确边界。

AAVAILABLE

MOONSHOT AI

Kimi K2.6

面向长文本、推理、视觉和代码任务的多模态模型,通过 Workers AI 在边缘运行。

  • OpenAI 兼容消息格式
  • 多轮对话
  • 流式输出
kimi-k2.6Workers AI native
BAVAILABLE

Z.AI

GLM 5.2

适合中文、复杂推理与智能编码工作流的旗舰模型,通过 Workers AI 绑定在边缘运行。

  • 262K 上下文能力
  • 推理与函数调用
  • 流式输出
glm-5.2Workers AI native
CNEW

MOONSHOT AI

Kimi K2.7 Code

为 Agent 编码工作流优化,支持视觉、结构化输出和多轮工具调用。

  • 262K 上下文
  • 函数与工具调用
  • 代码任务优先
kimi-k2.7-codeWorkers AI native
DNEW

OPENAI

GPT-OSS 120B

面向通用推理、Agent 和开发者任务的开放权重模型。

  • 128K 上下文
  • 推理能力
  • 函数调用
gpt-oss-120bWorkers AI native
ENEW

GOOGLE

Gemma 4 26B A4B

高效 MoE 开放模型,面向视觉、推理、结构化输出与工具调用。

  • 256K 上下文
  • 视觉与函数调用
  • Workers AI 原生前缀缓存
gemma-4-26b-a4b-itWorkers AI native

03 / API

一种 SSE 长流,
两种开放协议。

站内对话通过 SSE 传输长输出;Chat Completions 兼容常见聊天应用,Responses API 兼容 Codex 与 Agent 工具链。

POST/api/v1/chat/completions
POST/api/v1/responses
GET/api/models
REAL CMD TEST · HTTP 200
curl https://api-ai.js.gripe/api/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "kimi-k2.6", "messages": [ {"role": "user", "content": "你好"} ], "stream": false }'
点击终端复制完整命令执行 cURL 命令、等待 API 输出的终端画面
01 上层 · 请求已输入

04 / ENDPOINT GUIDE

每个端点,如何使用。

GET /api/models

读取公开模型、上下文窗口、最大输出和压缩阈值。

curl https://api-ai.js.gripe/api/models

POST /api/v1/chat/completions

兼容常见 OpenAI 聊天应用;stream: true 返回 SSE。

curl https://api-ai.js.gripe/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"kimi-k2.6","messages":[{"role":"user","content":"你好"}],"stream":true}'

POST /api/v1/responses

兼容 Codex 与 Responses 客户端;字符串或输入项数组均可。

curl https://api-ai.js.gripe/api/v1/responses \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-oss-120b","input":"你好","stream":true}'

GET /api/tools/web-search

读取联网工具与 Skill 清单;Responses 使用 {"type":"web_search"},Chat 可设置 web_search: "auto"

curl https://api-ai.js.gripe/api/tools/web-search
curl https://api-ai.js.gripe/api/skills/web-search

接入应用:Base URL 使用 https://api-ai.js.gripe/api/v1,无需 API Key。JSON 请求设置 stream: false;长输出设置 stream: true 并按 SSE 事件读取。联网工具采用 auto 时,由所选模型根据专属知识截止系统提示决定是否搜索;未声明工具的第三方请求默认 off。同一对话持续发送稳定的 x-session-affinity 可提高 Workers AI 原生前缀缓存命中率;响应头 x-kiln-prompt-cache 会说明是否启用亲和。API 保持无状态且不会静默压缩调用方上下文;可从 /api/models 读取阈值自行管理。完整 Schema 位于 /openapi.json

05 / HOW IT RUNS

静态前端,边缘后端。

  1. 01
    Pagekiln / Pages

    页面以静态资源发布,加载快、缓存友好。

  2. 02
    API Worker

    统一 SSE、Chat、Responses 与模型决策的 search.js.gripe 联网工具,流量策略交由 WAF。

  3. 03
    Workers AI

    通过 AI Binding 调用模型,浏览器永远接触不到 Cloudflare 凭据。