Skip to content

Latest commit

 

History

9 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

📚 Paper Reading Collection · 论文精读合集

我的论文中文精读页合集。每篇论文一个图文配合的单文件 HTML 精读页:全部 Figure / Table 以 300 DPI 高清 PNG 内嵌在对应讲解段落中(等比缩放、不裁剪),配中文逐点解读,支持深色模式、点击看原图、KaTeX 公式渲染、打印友好。

🌐 Bilingual · 中英双语:每篇论文均提供中文精读版 + 英文版——两篇旗舰论文(Declarative Attention、DeepSeek-V4.1-Flash)为完整英译(en.html),其余五篇为英文速读版(完整论证摘要 + 全部图表原文图注 + 英文导读)。门户页右上角一键切换 中/EN,首次访问跟随浏览器语言,切换后偏好会被记住。

This collection ships a full Chinese deep-read plus an English edition for every paper — complete English translations for the two flagship papers (Declarative Attention, DeepSeek-V4.1-Flash), and English quick-read editions (full digest of the argument + every figure with its original caption) for the rest. Toggle 中/EN from the portal topbar; the site follows your browser language on first visit and remembers your choice.

paper-reading-html skill 制作 · 在线门户:qqtang-code.github.io/Paper-Reading-Collection

论文总览

# 论文 分类 主题标签 语言 精读时间 图表 原文
1 Declarative Attention — Language Models Can Control Their Own Attention 注意力与 KV Cache 稀疏注意力 · KV Cache · 长上下文 · CoT · vLLM · EN 完整版 2026-09 10 图 10 表 arXiv:2609.02737
2 FreeToken — 边缘原生的 MoE 服务系统(Bandwidth-Adaptive Execution) 高效推理 MoE · 边缘部署 · 服务系统 · 带宽自适应 · EN 速读 2026-09 5 图 1 表 arXiv:2608.16157
3 ReSET — Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling 高效推理 量化 · NVFP4 · 低精度推理 · 温度缩放 · EN 速读 2026-08 8 图 16 表 arXiv:2606.13233
4 Random Attention — Rethinking KV Cache Eviction for Efficient Reasoning 注意力与 KV Cache KV Cache 驱逐 · 推理模型 · 长思维链 · vLLM · EN 速读 2026-09 5 图 11 表 arXiv:2609.03430
5 MMLongEmbed — 长上下文场景下的多模态嵌入模型基准 评测基准 多模态 · 嵌入模型 · 长上下文 · Benchmark · EN 速读 2026-08 6 图 16 表 GitHub
6 DeepSeek-V4.1-Flash — 552B 多模态 MoE 高效推理技术报告 高效推理 KV Cache 压缩 · MoE · 多模态 · 长上下文 · FP4 · EN 完整版 2026-09 12 图 5 表 项目页
7 Elastic Attention — Test-time Adaptive Sparsity Ratios for Efficient Transformers 注意力与 KV Cache 混合注意力 · 测试时自适应 · Attention Router · 长上下文 · EN 速读 2026-09 17 图 14 表 OpenReview · 代码

点击论文名直达精读页:① Declarative Attention · ② FreeToken · ③ ReSET · ④ Random Attention · ⑤ MMLongEmbed · ⑥ DeepSeek-V4.1-Flash · ⑦ Elastic Attention

目录结构

Paper-Reading-Collection/
├── README.md                    ← 本文件(总索引)
├── index.html                   ← 在线门户页(GitHub Pages 首页,中英双语切换)
├── attention-kv-cache/          ← 分类一:注意力与 KV Cache
│   ├── declarative-attention/   ← arXiv:2609.02737(10 图 10 表)
│   ├── random-attention/        ← arXiv:2609.03430(5 图 11 表)
│   └── elastic-attention/       ← OpenReview rLO2NTUHSW(17 图 14 表)
├── efficient-inference/         ← 分类二:高效推理与部署
│   ├── freetoken/               ← arXiv:2608.16157(5 图 1 表)
│   ├── reset/                   ← arXiv:2606.13233(8 图 16 表)
│   └── deepseek-v41-flash/      ← DeepSeek-V4.1-Flash 技术报告(12 图 5 表)
└── benchmarks/                  ← 分类三:评测基准
    └── mmlongembed/             ← 多模态长上下文嵌入基准(6 图 16 表)

每个论文目录:中文精读页(index.html 或 <论文名>精读_HTML.html)
            + en.html(英文版:DA 与 DeepSeek-V4.1-Flash 为完整英译,其余为英文速读)
            + figs/(300 DPI 图表原图,中英文页共用)

分类按"优化的层次"组织:注意力与 KV Cache 解决注意力层怎么看、KV 怎么留;高效推理与部署 解决模型与系统层怎么更快更省(量化、架构压缩、服务系统);评测基准 度量模型真实能力。

分类与各篇速览

🎯 attention-kv-cache/ · 注意力与 KV Cache

让注意力本身更省:看得更少(稀疏化)、留得更少(KV Cache 驱逐)、稀疏比按输入自适应。

① Declarative Attention(2026-09 · KAIST AI × Google DeepMind) 让模型在思维链里用 <global> / <focus> / <local> 标签声明自己要看哪里,推理引擎像解析工具调用一样解析声明并跳过大部分 KV cache 读取——零训练、零样本。15 项长上下文任务上注意力读取降 52.0% / 31.1%(Gemma-4-31B / Qwen-3.6-27B),精度仅降 1.27pp / 2.75pp;roofline 估算解码墙钟降至 0.71× / 0.77×。→ 精读页 · 原文

④ Random Attention(2026-09 · Salesforce AI Research + UIUC) KV cache 驱逐不需要打分:保住 prompt + 每个 KV 头内均匀随机驱逐、不打任何分,4 模型 × 6 推理任务追平最强基线(60 格中 31 格显著领先、仅 1 格落后),vLLM 部署吞吐再快 32–43%。机制账:prompt 是 cache 的脆弱部分;推理轨迹靠"文本复述 + 跨头复制"两层冗余自我保护——选择信号真正剩下的用武之地,是"只说一次、从不复述"的稀有事实。→ 精读页 · 原文

⑦ Elastic Attention(2026-09 · 苏州大学 LCM Lab × 百度,ICML 2026 投稿) 混合注意力(FA + 稀疏注意力 SA)的 FA/SA 比例从静态超参数变成输入自适应:每层挂一个 0.27M 参数的轻量 Attention Router(Gumbel-Softmax + STE 训练),推理时按输入把每个 KV 头分配到 FA 或 SA——摘要/代码任务稀疏到 ~0.82、问答任务守住 0.63–0.68。8×A800 训练 12 小时、骨干完全冻结,Qwen3-4B/8B 与 Llama-3.1-8B 在 LongBench-E 平均分全部第一,RULER 外推 256K 优势最大;融合 kernel 让同层不同模式的头一次前向算完,加速 1.51×–3.28×,路由器延迟仅 0.196 ms 且与序列长度无关。→ 精读页 · 原文 · 代码

⚡ efficient-inference/ · 高效推理与部署

在模型与系统层让 LLM 推理更快、更省、能部署到更小硬件:低精度量化、架构与 KV 压缩、服务系统。

② FreeToken(2026-09) 把个人电脑变成统一的弹性推理平台:带宽自适应执行(Bandwidth-Adaptive Execution)让 8GB 显存笔记本跑 35B 模型、游戏台式机跑 284B、单张工作站 GPU 跑 753B GLM-5.2,且快到能支撑真实 agent 负载。→ 精读页 · 原文

③ ReSET(2026-08) NVFP4 低精度推理在延迟敏感(交互式)场景下的精度救星:步骤感知温度缩放(Step-Aware Temperature Scaling)按解码步骤动态调整 softmax 温度,在不牺牲延迟的前提下恢复量化精度。→ 精读页 · 原文

⑥ DeepSeek-V4.1-Flash(2026-09 · DeepSeek 技术报告) 552B 多模态 MoE:Causal Encoder-Decoder 让 prefill 只激活 8B(decode 16B);CSA2 跨层 KV 复用 + FP4(MXFP4)量化把全局 KV Cache 压到每 token 890 字节(V4-Flash 的 1/4、V1 的 1/437),SWA Bounded Replay 再把持久缓存压到上代的 1/8;配 196B 条件记忆 Engram 与 45T 多模态 token 预训练,性能反超更大的 V4-Flash——DeepSWE v1.1 74.2、Terminal-Bench 2.1 90.6、Codeforces 3471。→ 精读页 · 项目页

📏 benchmarks/ · 评测基准

度量模型真实能力的研究。

⑤ MMLongEmbed(2026-08) 首个专门评测多模态嵌入模型(MEM)长上下文能力的基准:4 个检索任务、8 个数据集、8,460 个查询、11 个模型。核心发现:现役模型依赖表面特征匹配"作弊",细粒度信息保持随上下文长度显著衰退——"窗口大"不等于"读得懂"。→ 精读页 · 原文

如何阅读

  • 在线:打开 GitHub Pages 门户,或直接访问上表任一精读页链接;
  • 本地:git clone 后用浏览器打开任意论文目录下的 index.html(图片为相对路径 figs/,无需联网;公式渲染需联网加载 KaTeX CDN);
  • 语言切换:门户页与每个精读页顶栏都有 中/EN 按钮——中文页点击 EN 跳转同目录 en.html,英文页点击 中文 跳回中文精读页;首次访问跟随浏览器语言,偏好保存在浏览器本地(localStorage pr-lang)。

每个精读页的章节结构大致为:速览 → 背景 → 方法 → 系统实现 → 实验 → 规模化 → 讨论/点评 → 术语速查,图表内嵌在对应讲解段落里,而非单独的图库。英文速读版结构对应:Overview → Background → Observations/Challenges → Method → Kernel/System → Results → Commentary → Glossary,包含全部图表与原文图注。

如何新增一篇精读

  1. paper-reading-html skill 生成精读页(index.html + figs/),并按 skill 的溯源规范补齐:速览章「读数约定」、上游方法的行内引用、点评章「技术来源一览」与「未披露、值得补测」清单、图注原文页码(scripts/add_pagerefs.pycrops.json 批量注入);
  2. 放入对应分类目录(没有合适的分类就新建一个);
  3. 在本 README 的总览表格与分类速览里登记一行;
  4. push 到 main,GitHub Pages 自动更新。

说明

  • 各精读页此前以独立仓库发布(ReSET-Project-PageMMLongEmbed-PaperReading-PageFreeToken-Project-PageDeclarative-Attention-Project-PageDeepSeek-V4.1-Flash-Project-PageElastic-Attention-Project-Page),现已整合至本仓库;旧仓库与其 Pages 链接暂时保留,后续可归档。
  • 分类调整:注意力层的工作(Declarative / Random / Elastic Attention)已从 efficient-inference/ 移至 attention-kv-cache/,旧链接留有自动重定向页面。
  • 精读页中的解读文字为编者观点,关键数字均与论文原文核对;图片以 300 DPI 摘自原文,版权归原作者所有,仅供学习研究。

About

No description, website, or topics provided.

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages