AI Coding 省流指南

1. 核心大招:强制“增量输出”(Diff-Only) 这是节省 输出 Token 最有效的手段。默认情况下,大模型喜欢把整份代码文件重新写一遍,即便它只改了一行。 笨办法:“帮我修改这个文件的 bug。”(模型直接吐出 500 行代码) 妙招:在 Prompt 中明确限制输出格式。 Prompt 模板: “请只输出修改过的代码片段。未修改的部分请用 // ... 保持不变 ... 或 # ... existing code ... 代替。如果可以,请直接以 Git Diff 的格式提供修改方案。” 2. 输入“骨架”而非全量代码(Skeleton Prompting) 当你需要让模型理解你的项目结构或某个工具类时,不要直接把几千行的源文件贴过去。 妙招:只给模型提供类型定义(Types/Interfaces)、函数签名(Function Signatures) 或 骨架代码。 例如(TS/JS): // 不要贴整个实现,只给这个: interface UserService { getUser(id: string): Promise<User>; updateProfile(id: string, data: Partial<User>): Promise<boolean>; } 模型只需要知道“有什么方法可用”以及“入参和出参是什么”,并不需要知道你内部复杂的 SQL 是怎么写的。 3. 巧用 XML 标签(对 Claude 尤为有效) Claude 对 XML 标签(如 <code_>)有着极强的敏感度。用 XML 标签包裹代码和指令,不仅能提高准确率,还能减少解释性废话。 <system_instruction> 你是一个极简主义的编程助手。请直接输出代码,不要解释,不要说“好的,我为你准备了以下代码”。 </system_instruction> <source_code> // 贴入你的核心代码 </source_code> <task> 重构上面的代码,提高运行效率。 </task> 省流原理:明确的结构让模型不需要在 Prompt 里猜测“哪里是代码,哪里是要求”,从而大大减少了模型的推理和多余的客套话(“Certainly! Here is…” 也是要算 Token 的)。 ...

2026-07-15 02:39:13 PM · 1 分钟

漫谈AI上下文长度

flowchart TD A[2018–2021512–2K Token金鱼记忆时代] -->|只能处理短文、短句、单轮问答| B[2022–20234K–128K Token中上下文普及时代] B -->|可处理论文、合同、小说、中型代码库RAG 成为企业标准方案| C[2024–2025200K–1M Token百万上下文实验期] C -->|纸面支持 1M,但遗忘、成本、速度问题明显仅限量 Beta| D[2026–20271M–2M Token1M 量产普惠时代] D -->|1M 成为旗舰标配可处理整卷宗、整代码库、全年业务日志| E[2028–20292M–10M Token超百万窗口分化时代] E -->|2M 以上面向行业定制长视频、大型代码库、多年日志联合分析| F[2030+10M+ 弹性记忆原生长记忆智能体时代] 一、大模型上下文完整进化时间线(2018–2026,分4个时代) 1. 初代Transformer时代:512–2K(2018–2021,金鱼记忆) 2018 GPT-1 / BERT:512 token,仅短文、短句分类,多轮对话必丢前文 2019 GPT-2:1024 token,能写短篇故事,连续对话3–5轮就遗忘历史 2020 GPT-3:2048 token(2K),行业通用标准,仅支持短提示词、少量示例,长文档必须分段/摘要处理 2021 早期国产(文心一言初代、GLM-1):统一2K上限,无长文本能力 时代特征:没有原生长文本能力,所有长内容必须靠人工拆分、外部摘要,RAG雏形出现。 2. 中上下文普及时代:4K–128K(2022–2023,工业化可用) 2022 ChatGPT(GPT-3.5):4K;年末升级16K,日常聊天够用,长文档仍吃力 2023.3 GPT-4 首发:8K,专业文档、代码单文件处理门槛打开 2023.7 Claude 2:100K,首个量产十万级窗口,法律、长篇论文场景爆发 2023.11 GPT-4 Turbo:128K,全球主流商用标配门槛,单本小说完整载入 2023年底 国产跟进:通义、GLM、混元开放32K/64K;开源Llama 2、Qwen 7B固定4K–32K 2023.12 Gemini 1.0 Ultra 纸面宣称1M,但仅实验室封闭测试,无法商用落地 时代里程碑:128K成为专业AI标配;RAG成为行业标准方案,弥补窗口不足。 3. 百万上下文实验期:200K–2M纸面(2024–2025,纸面强、实际弱) 2024.2 Gemini 1.5 Pro:原生2M token,全球首个公开百万级模型,但存在严重「中间遗忘Lost in the Middle」,后半段文档召回暴跌,仅适合摘要,不适合精细推理,仅限开发者限量Beta 2024 Claude 3 Opus:200K,稳定可靠,法律行业主力,无严重遗忘问题 2025 上半年:各大厂商放出1M Beta(Claude Sonnet 4、Gemini 2.0),长上下文计费溢价极高、响应慢、显存开销巨大,企业少量试用,普通用户无法接触 2025 国产开源:Qwen、DeepSeek推出64K–128K底座,少量实验版支持256K 时代特征:1M只是技术噱头,标称≠有效;硬件成本、遗忘问题、价格三重门槛,无法大规模落地。 ...

2026-07-09 08:58:34 PM · 2 分钟