Developer Docs

文档首页

开发文档 · 运行应用

可观测与故障处理

使用运行事件、用量和日志定位 Fellow 应用故障的当前方法与边界。

成熟度:Experimental

目标

帮助应用开发者和平台运维人员区分传输、模型、工具、沙箱、Connector 与策略故障,并保留可以跨组件关联的诊断上下文。

当前可用

  • Gateway 持久化 Run 的 StreamEvent,可用于查看运行步骤和工具调用。
  • Gateway 按 Run 聚合 Token,并提供用户、模型和接入应用等用量视图。
  • Desktop 和 Server 可从各自运行环境获取进程日志;具体采集、保存和访问方式取决于部署形态。
  • Thread ID、Run ID、事件序号和可用的请求关联信息是排障时应共同保存的上下文。

建议先确认故障阶段:认证与 Scope、创建 Run、SSE 传输、模型调用、工具或 Connector、Sandbox / Host、终态持久化。不要仅根据 UI 未显示结果就重试有副作用的操作。

边界

  • Logs、Metrics、Traces 与 Audit 用途不同。运行日志不能替代安全审计,业务事件也不应默认复制到监控系统。
  • 当前没有对外承诺统一的 OpenTelemetry schema、指标名称、保留期或告警模板。
  • 多实例实时流、分布式 Trace 和跨 Gateway 的统一关联能力不能从默认单节点配置推断。
  • 日志和错误必须过滤 API Key、access token、Connector Secret、本机绝对路径及未经授权的业务内容。
  • 是否可重试必须按具体失败阶段判断;通用错误 envelope 和全协议可重试标记尚未完成。

未来能力

Planned: 统一 Logs / Metrics / Traces / Audit 关联模型、Run 成功率与 P95 延迟指标、模型和工具错误分类、Sandbox 资源指标、告警与人工接管入口。公开名称和导出格式在契约冻结前不作为集成承诺。

相关文档