跳到主要内容

推理运行时

推理运行时

推理是一次带 schema 校验结果的模型调用。本页介绍这些调用内部如何执行:绑定、结构化输出、流式传输,以及记录存储在哪里。

ai 绑定

调用经由 ai 设施端口——由宿主提供的绑定,具体提供商在运行时接线。运行时从不直接与提供商对话,也从不持有提供商凭据。

结构化输出

运行时要求模型按 schema 输出,并在返回途中校验。格式错误的结果会重试或作为错误呈现——绝不会以未类型化的方式传给租户代码。

  prompt + schema
        │
        ▼
  ┌────────────────────────────┐
  │  ai facility binding       │
  │  (host provider at runtime)│
  └────────────┬───────────────┘
               │  model output
               ▼
  schema validation
        │
        ├── valid ──► typed result to caller
        │
        └── invalid ──► retry or error (never untyped)

流式传输

推理是当前调用中的设施 I/O。Guest 让出,宿主调用模型,随后同一次调用在同一工作线程中恢复。等待期间工作线程与容量槽位仍被分配,但等待时间不计为工作线程 CPU。模型 token、成本与轮次计量在会话行上。

会话存储

每次对话都持久化为一个租户自有的 chat_session 聚合。顺序消息、嵌套轮次、标题、状态和计量用量会一起同步和审计。

编写面是 推理 ;使用该运行时的 Agent 循环见 Agent loop。