跳到正文

Tag archive

#性能优化

2 篇 · 按时间倒序

2026-09-18

为了拿一个布尔值,大模型在后台吐了八百个 Token

TypeSafe Jev 放弃了自回归生成,只输出选择、评分与校准概率。它在机制上消除了生成式幻觉,但并不代表判断永远正确。依靠真实的概率校准与极低延迟,它替代通用大模型跑分类路由,让代码在确定性的防御带里接管业务分支。
2026-03-24

KV Cache:为什么 AI 回复越来越快?

KV Cache 是大模型能快速响应长对话的核心机制:将历史内容的中间计算结果缓存起来,避免每次生成新词都重新计算所有上文,以显存空间换取时间,同时大幅降低 API 调用成本。