阁子

PromptCache:LLM 语义缓存网关的架构与实现

LLMCacheGo

线上的 LLM 调用看多了,会发现请求高度重复:客服机器人翻来覆去就那几问,RAG 内部问答也扎堆。 按 token 计费的上游对着重复问题一遍遍生成,钱白烧,延迟也压不下来。 传统精确匹配缓存在自然语言面前几乎无命中——「怎么退货」和「…

QM,给全公司用的 agent 平台

市面上的 agent 几乎都按个人助理的样子设计,一个人用很顺,搬进公司就开始别扭:所有人共享一份记忆和一台沙箱,配置互相踩,权限一刀切。 QM 反过来,从第一天就按「多人」设计:每个人、每个频道各有一套隔离的工作空间,又能在同一个组织里…