推理运行时
推理运行时
推理是一次带 schema 校验结果的模型调用。本页介绍这些调用内部如何执行:绑定、结构化输出、流式传输,以及记录存储在哪里。
ai 绑定
调用经由 ai 设施端口——由宿主提供的绑定,具体提供商在运行时接线。运行时从不直接与提供商对话,也从不持有提供商凭据。
结构化输出
运行时要求模型按 schema 输出,并在返回途中校验。格式错误的结果会重试或作为错误呈现——绝不会以未类型化的方式传给租户代码。
prompt + schema
│
▼
┌────────────────────────────┐
│ ai facility binding │
│ (host provider at runtime)│
└────────────┬───────────────┘
│ model output
▼
schema validation
│
├── valid ──► typed result to caller
│
└── invalid ──► retry or error (never untyped) 流式传输
推理是当前调用中的设施 I/O。Guest 让出,宿主调用模型,随后同一次调用在同一工作线程中恢复。等待期间工作线程与容量槽位仍被分配,但等待时间不计为工作线程 CPU。模型 token、成本与轮次计量在会话行上。
会话存储
每次对话都持久化为一个租户自有的 chat_session 聚合。顺序消息、嵌套轮次、标题、状态和计量用量会一起同步和审计。
相关指南
编写面是 推理 ;使用该运行时的 Agent 循环见 Agent loop。