阁子

Semantica:面向可审计 AI 的图原生基础设施

上一篇拆了管省钱的 prompt-cache,这篇接着拆管认账的。 Agent 跑在生产上有个老问题:它存的是 embedding,不是意义——上下文说不清来历,决策事后无从审计。 在信贷、医疗这类行当里,「AI 为什么这么判」是监管几个…

PromptCache:LLM 语义缓存网关的架构与实现

LLMCacheGo

线上的 LLM 调用看多了,会发现请求高度重复:客服机器人翻来覆去就那几问,RAG 内部问答也扎堆。 按 token 计费的上游对着重复问题一遍遍生成,钱白烧,延迟也压不下来。 传统精确匹配缓存在自然语言面前几乎无命中——「怎么退货」和「…