<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Cost-Optimization on 编程心语</title>
		<link>https://www.ithome.me/tags/cost-optimization/</link>
		<description>Recent content in Cost-Optimization on 编程心语</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Mon, 03 Aug 2026 19:09:21 +0000</lastBuildDate>
		
			<atom:link href="https://www.ithome.me/tags/cost-optimization/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>LLM API 缓存实战：三层缓存把大模型调用成本打下来</title>
				<link>https://www.ithome.me/post/2026/08/04/llm-api-cache-practical-guide/</link>
				<pubDate>Tue, 04 Aug 2026 08:00:00 +0800</pubDate>
				<guid>https://www.ithome.me/post/2026/08/04/llm-api-cache-practical-guide/</guid>
				<description>&lt;h2 id=&#34;为什么你的-llm-账单越烧越高&#34;&gt;为什么你的 LLM 账单越烧越高&lt;/h2&gt;&#xA;&lt;p&gt;接入大模型三个月，账单比想象中高出一大截。翻日志发现一个扎心的事实：&lt;strong&gt;大量请求是重复的&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;定时任务每天早上用同一份模板汇总数据，prompt 一字不差，却每次全价调用；&lt;/li&gt;&#xA;&lt;li&gt;用户提问&amp;quot;帮我解释下这段代码&amp;quot;和&amp;quot;这段代码什么意思&amp;quot;，语义相同，模型却要重新推理一遍；&lt;/li&gt;&#xA;&lt;li&gt;长 system prompt（几千 token 的角色设定 + 知识库）每次请求都重复计费。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;LLM 按 token 计费，重复推理就是纯浪费。本文分享一套实战验证过的三层缓存方案，从上到下依次是：&lt;strong&gt;精确缓存 → 语义缓存 → 供应商 Prompt Cache&lt;/strong&gt;，三层叠加通常能把成本降 50% 以上，顺带把响应延迟从秒级降到毫秒级。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
