AI 基建
0%
第十一部分 · 实践与运营

第十一部分 · 实践与运营

作者Changkun Ou
阅读时长约 1 分钟

「能运转的复杂系统,总是从能运转的简单系统演化而来。」

John Gall,"Systemantics"

第十一部分转入实践视角。第九部分暴露了技术栈下方的物理与前沿极限;第十部分则说明这些极限怎样变成市场、开放选择、采用模式和数据权利交易。到了这一部分,要问的是另一类问题:一个团队该怎样把这套栈接起来,让它长期运转下去。问题不再只是追踪机制,而是在期限、预算、许可证、可靠性目标、模型版本变化和生产事故之间做选择。

第 81 章 从第一个岔路讲起:租用前沿模型,运行开放模型,还是保留两条路。第 82 章第 83 章第 84 章 把选择落到服务引擎、网关、算力、端侧部署和微调决策。第 85 章第 86 章 接入框架、沙箱、MCP、文档解析、检索和抽取。第 87 章第 88 章 把这些部件连成一套面向 2026 年技术栈的参考架构,带评测、可观测性、预算和回退。最后,第 89 章第 90 章第 91 章第 92 章第 93 章 处理长期运行:发布、回滚、非确定系统的可靠性、降级、人机审查表面、批准门、生产数据、SLO、成本治理、事故、多租户,以及怎样把失败变成下一轮测试。

这一部分不是一份可以直接复用的清单。更稳妥的理解,是把生产 AI 系统看成一组契约,也就是系统必须始终维持的运行不变量:模型是否固定,预算在哪里执行,数据从何处来,工具在哪个沙箱里跑,哪条租户边界受到保护,哪个人工门批准副作用,哪套评测能挡住发布,哪份事故记录会改变系统,哪类失败会进入数据回路。等这些契约都清楚了,技术栈才不再是一堆工具,而是可以运营的系统。

评论

登录后评论