查看: 1|回复: 0

Hugging Face 官方频道出品的一期技术科普视频,由Alejandro AO主讲,主题是提示词缓存(prompt caching)

[复制链接]

19

主题

0

回帖

57

积分

注册会员

积分
57
发表于 1 小时前 | 显示全部楼层 |阅读模式
Hugging Face 官方频道出品的一期技术科普视频,由Alejandro AO主讲,主题是提示词缓存(prompt caching)——一个能帮你在 AI 编码智能体上大幅省钱的机制。#微博视频号续航计划#

他先澄清一个常见误解:提示词缓存不是缓存 LLM 的"输出"(那没有意义),而是缓存"输入"——因为编码智能体每轮对话都要把整段对话记录(比如 5 万、5 万 1 千、5 万 5 千词元)反复重发给 LLM,如果不缓存,费用会指数级上涨。

他对比了 OpenAI、Anthropic、Gemini、Kimi K3、Grok、DeepSeek 等提供商的定价(一个 20 万词元的会话,Opus 和 GPT-5.6 Sol 不开缓存要 41 美元,而 DeepSeek 便宜到几乎免费),并演示自己用 DeepSeek V4 Flash 跑出 1090 万词元交换只花了 6 美分。

视频还给出最佳实践:注意各提供商缓存过期时间(OpenAI 一小时、Anthropic 五分钟)、确认提供商是否自动缓存(OpenAI/HF 自动、Anthropic/Gemini 不自动)、绝不要在系统提示词里放动态内容(时间戳、当前工作目录等),否则会让整个缓存失效,以及上下文压缩会重置缓存;最后建议用一个能监控缓存命中率的Harness。 http://t.cn/AXp4MwpM

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部