MingJunDuan的博客
热爱可抵一切,探索未知之境
全站访问量

企业级记忆知识库:短期上下文与四层记忆的 RAG/向量检索实现

你是一个 Java 后端工程师,手上有一个订单中心。某天你让 Agent “帮我在下单流程里加一个库存不足的兜底”。 它没有翻代码,也没有问你 createOrder 里调了哪几个服务,而是直接告诉你: 下单流程依次是 RiskService.checkRisk → InventoryService.freezeStock...

LLM 应用后端接入工程 —— 基本功:一个普通后端服务怎么正确调大模型

你在一个 Spring Boot 服务里写下了第一行”调大模型”的代码:一个 HTTP 客户端,一个 POST /v1/chat/completions,一个手工拼出来的 JSON。跑通了,心里却越来越没底——因为你知道这只是”能跑”,离”能上生产”还差得远。 然后你去查资料。查到 MCP,讲的是”工具标准”:服务器怎么暴露工具、客户端怎么发现工具、JSON-RPC 怎么来回。查到...

Token 不是字也不是词:300K 上下文窗口到底能装多少行代码

你在 Cursor 里把整个 Service 目录 @ 进去,说”帮我把这段下单逻辑重构一下”,结果它回你一句 context_length_exceeded。你心里纳闷:不是说好 200K、300K 的上下文窗口吗?我这才几万行代码,怎么连一个模块都塞不下? 问题的根子,在于把 token...

Agent 的循环与目标:一个 Agent 到底是怎么自己跑起来的

两个场景,先请你感受一下”跑起来”和”答出来”的差别。 场景 A:你在聊天框里问”Redis 主从复制怎么实现?”。模型给你一段洋洋洒洒的回答,你点个赞,对话结束。整个过程一次调用、一次返回,干净利落。 场景 B:你说”把项目里所有日志改成带 traceId 的格式,跑一遍单测,失败的发我报告。”模型先翻目录、定位日志框架、改代码、跑测试、解析失败信息、再改、再跑……中间可能有几十次工具调用,跨度可能是一小时。你中途去开了个会,回来发现它已经把报告整理好了,还顺手把没改干净的两处标了出来。 同样是”一个输入”,A 是一次函数求值,B 是一场持续运转。前几篇我们讲了大模型本身(《从大模型到 Agent》)、讲了大模型没有状态(《大模型无状态》)、讲了...

让大模型修 bug 时,它脑子里到底发生了什么

你给大模型贴了这样一段,然后问”这个空指针怎么回事”: public class OrderService { private OrderMapper mapper; public String getOrderName(Long id)...