失败代价高的任务
先选 20–50 条最难样本,比较 Sol 是否显著减少错误、重试或人工修改。
单位为人民币 / 百万 Token。比较时不仅要看单价,还要记录一次通过率、重试次数、人工复核和任务价值。
| 号池 | 输入 | 输出 | 验证重点 |
|---|---|---|---|
| Sale | ¥0.60 | ¥3.60 | 小样本效果与可用性 |
| Plus | ¥1.00 | ¥6.00 | 稳定性与错误恢复 |
| Pro | ¥2.00 | ¥12.00 | 业务价值是否覆盖成本 |
价格来自 LinkAGI 公共 pricing API 与模型广场快照;实时号池、模型和账单可能变化。
先选 20–50 条最难样本,比较 Sol 是否显著减少错误、重试或人工修改。
用统一仓库、提示词和验收测试对比模型;以测试通过和最终修复为结果,不只看回答长度。
Sale 输出约 ¥3.60/百万 Token。让模型先给计划、再按需展开,通常比无约束长答案更可控。
先由低档模型处理常规样本,通过规则或人工判断把失败样本升级到 Sol。
输入与输出分别计价,记录平均值和 P95,而不只看一次演示。
把重试、超时、人工修改和错误交付纳入比较,得到真实有效结果成本。
根据任务难度、失败次数或业务价值触发 Sol,控制全量路由的浪费。
不一定。只有当效果提升、重试减少或业务价值覆盖成本差异时,Sol 才可能更划算。
约束输出格式和长度,先生成计划再按需展开,并在控制台监控单次输出 Token 和异常长请求。
应根据实时可用性、业务容错和预算设计切换方案;页面不会把某个快照当成永久 SLA。
把真实输入、输出和调用次数代入,比较 Sol 带来的有效结果。