# 调研二：AI员工托管服务的技术可行性——缓存 + 多模型路由 + 统一运维

## 一、Prompt/Context 缓存：三大厂商机制对比

### 1. Anthropic Claude Prompt Caching
- 价格：5分钟TTL缓存写入 = 基础输入价×1.25；1小时TTL写入 = ×2；缓存读取 = 基础输入价×0.1（90%折扣）。
- 最小可缓存token数：因模型而异，512-4096不等，多数主力模型约1024。
- TTL：默认5分钟，可显式指定1小时（可分层混用）。
- 限制：缓存查找最多回溯20个block；工具定义/图片增减/tool_choice变化会使缓存失效；思维块不可直接缓存。
- 官方口径：长prompt场景下可降低成本最高90%、降低延迟最高85%（首token时间）。
- 来源：[Claude Prompt Caching官方文档](https://platform.claude.com/docs/en/build-with-claude/prompt-caching)，[Anthropic官方X公告](https://x.com/AnthropicAI/status/1925633128174899453)，[Token-saving updates博客](https://claude.com/blog/token-saving-updates)

### 2. OpenAI Prompt Caching
- 全自动隐式触发，1024个可见输入token起触发，之后以128 token为增量扩展匹配。
- 折扣：缓存读取=未缓存价×0.1（GPT-5.6及后续版本）；缓存写入=×1.25；早期版本折扣结构不同。
- 缓存时长：GPT-5.6+默认最近一次写入/复用后30分钟；更早版本约5-10分钟，另有可达24小时的模式。
- 限制：仅折扣input token，不影响output token定价。
- 来源：[OpenAI Prompt Caching官方文档](https://developers.openai.com/api/docs/guides/prompt-caching)

### 3. Google Gemini Context Caching
- 两种模式：Implicit（2.5+模型默认自动开启）vs Explicit（手动创建缓存对象、设置TTL）。
- 最小token数：2048（2.5系列）到4096（3.x Preview）不等。
- 价格：缓存读取约为基础输入价10%左右，存储费另计（第三方数据，Google官方页面未直接列出完整表，价格以[官方定价页](https://ai.google.dev/gemini-api/docs/pricing)为准）。
- 来源：[Gemini Context Caching官方文档](https://ai.google.dev/gemini-api/docs/caching)

**小结**：三家缓存机制都是**已稳定运行生产环境多年的成熟功能**，不是概念验证。核心共性是"缓存读取约为原价10%"，只优化input token，且都有最小token数门槛——对"长系统提示词+多轮对话+重复上下文"场景收益最大，这恰好是"AI员工"托管的典型形态（同一套system prompt/工具定义服务多次调用）。

## 二、多模型路由/级联（Model Routing / Cascading）

### 学术基础
- **RouteLLM**（LMSYS/UC Berkeley）：训练路由器，在MT-Bench上实现约85%成本下降，同时保持95%的GPT-4级别质量（[论文](https://arxiv.org/pdf/2406.18665)）。
- **FrugalGPT**：路由器+质量阈值判断+停止判定三段式架构，跨基准测试最高98%成本下降。
- 综述：[Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey（2026）](https://arxiv.org/html/2603.04445v2)——路由/级联是有持续学术产出的成熟研究方向，产业界普遍认可"做得好可降本40%-85%，质量损失可控"这一区间。

### 商业/开源工具

| 工具 | 定位 | 成熟度 |
|---|---|---|
| LiteLLM | 开源LLM网关/代理，支持140+供应商、1892+模型，内置fallback/负载均衡/虚拟key/预算控制 | 生产环境广泛使用，需自建部署运维（[文档](https://docs.litellm.ai/docs/proxy/reliability)） |
| OpenRouter | 托管型路由服务，统一API访问70+供应商，按价格倒数平方加权自动选低价供应商 | 商业化成熟，收约5.5%markup（[官方博客](https://openrouter.ai/blog/insights/model-routing/)） |
| GPTCache | Zilliz出品的开源语义缓存库（非模型路由，是语义相似度缓存） | 仍在维护，但生产风险不小：阈值设置不当假阳性率可达99% |

### 语义缓存的真实风险（容易被忽略但很关键）
语义缓存基于相似度匹配而非精确匹配，阈值设太低（如0.85）会把"如何重置密码"和"如何修改邮箱"误判为同一问题返回错误答案；阈值太高又导致命中率骤降。生产建议：阈值起点0.9以上，需用100+真实场景问题验证测试，并持续监控"错误命中率""过期答案率"。**语义缓存不是开箱即用的降本银弹**，需要针对每个客户场景调优——这直接关系到"服务多个中小企业客户"时能否标准化复制。
来源：[Portkey语义缓存阈值博客](https://portkey.ai/blog/semantic-caching-thresholds/)，[Redis语义缓存技术博客](https://redis.io/blog/how-to-cache-semantic-search/)

## 三、统一运维/LLMOps平台（多客户/多租户能力）

| 平台 | 定位 | 多租户能力 | 定价参考 |
|---|---|---|---|
| Portkey | 可观测性→生产AI控制面板，路由+可靠性+安全+治理一体 | 明确支持多租户，官方有[Multi-Tenant AI Feature指南](https://portkey.ai/docs/guides/use-cases/multi-tenant-ai-feature) | 起价约$49/月 |
| Helicone | 轻量代理式日志/观测，改一行base URL即可接入 | 2026年3月被Mintlify收购，偏单团队可观测 | 月消费<3万美元场景适用 |
| Langfuse | 开源可观测/tracing，支持agent多步骤span级追踪 | 需自建多租户隔离逻辑，云版约$29/月起 | 月消费3-20万美元、多步骤agent场景 |
| LangSmith | LangChain生态深度集成 | 多租户能力一般，强项在LangChain链路调试 | 约$39/座席/月 |

**小结**：四类工具都是**当前正在被大量团队生产使用的成熟产品**，不存在"技术不存在需要自研"的问题。Portkey在"多客户+统一治理"这个具体需求上契合度最高，把"按租户分路由规则/预算/护栏"当作核心卖点。

## 四、成本降低的真实数据汇总

1. 缓存单独降本：官方口径普遍"最高90%"（针对cached部分input token，需长上下文/重复调用场景才能达到上限）。
2. 路由/级联单独降本：学术研究40%-98%区间（RouteLLM约85%，FrugalGPT最高98%），是特定基准测试下的结果，**不能直接等同任意企业真实业务场景的降本比例**。
3. 中文资料口径（非一手权威，仅供参考）：分层路由（80-90%简单请求用轻量模型）+缓存命中，整体成本可压至"全用旗舰模型"的30%-50%。
4. **重要提醒**：调研中发现大量2026年新出现的英文SEO内容站（aicostcheck.com、burnwise.io等）高度雷同，很可能是AI批量生成的营销文章，其具体数字多为转述或互相转载，不构成独立可信验证。真正可交叉验证的权威数字来自Anthropic/OpenAI/Google官方文档和arXiv学术论文。

## 五、明确判断：这套技术方案现在能不能落地？

**结论：技术上完全可行，且都是现成、成熟、被广泛生产使用的组件，不需要自研底层技术。**

但有三个现实约束，是"能落地"和"能稳定赚钱"之间的差距：
1. **降本比例是场景依赖的，不是恒定百分比**。给客户承诺具体百分比之前，必须先跑该客户真实workload的基准测试。
2. **语义缓存有质量风险，需要额外验证/监控投入**，阈值调低可能返回错误答案，砸自己招牌。
3. **"多客户"意味着多租户隔离、计费追溯、SLA责任划分**，工具提供骨架，具体业务系统对接、异常处理、数据隔离合规仍需团队自己搭建"最后一公里"。

## 六、给小团队的落地建议

**几个人规模的团队，判断是：不要自研底层缓存/路由引擎，直接用现成工具组装，把精力放在业务场景适配+客户交付上。**

推荐组合：
- 网关+路由+多租户治理：Portkey（或自托管LiteLLM，若有DevOps能力想省SaaS费）
- 可观测性：Langfuse（开源，可自托管，适合多步骤agent场景）
- 模型层缓存：直接用Anthropic/OpenAI/Gemini原生API，不需额外中间件
- 语义缓存（可选，谨慎上）：GPTCache，但必须针对每个客户单独做阈值调优和上线前验证，不建议默认全局开启

**大致成本量级**（第三方定价，非官方权威数字，仅供量级参考）：网关类SaaS起价约$49/月，开源可观测起价约$29/月，加上模型API调用费用（这才是大头，正是缓存+路由要优化的对象）。几人团队服务数十个中小企业客户，工具链固定成本大概率在每月几百美元量级，远低于自建基础设施投入。

**一句话总结**：这不是"要不要发明轮子"的问题，轮子已经又多又成熟；小团队真正的工作是把轮子拼装好、针对每个客户场景验证降本比例是否属实，不要把"最高90%"这种厂商宣传语当成对客户的保证承诺。
