外观
前沿进展
"前沿"是个陷阱词。它既意味着机会,也意味着最密集的信息噪声——每天 arXiv 上涌现数百篇论文、每周有新的模型发布、每条研究主线都有人在宣告"范式变革"。如果不加方法地追,你会疲于奔命;但如果完全无视,你会错过这个领域十年一遇的结构性变化。
本文的目标是给出一张有方法的地图:先讲清楚如何低成本、低噪声地追踪前沿(渠道与优先级),再拆解当下最值得关注的六条研究主线(现状、代表工作、关键问题),然后诚实回答"哪些问题还没解决",最后给出选择深耕方向的具体建议。它既是前沿导航的展开,也与核心论文精读、常见问题互为补充。
一、如何追踪前沿
前沿信息不是太少,而是太多。有效的追踪者做的不是"全部读完",而是建立一条有优先级的信号管道。
1. arXiv:一手战场
几乎所有重要工作都以预印本形式先发在 arXiv 上,随后才被会议接收。对机器学习研究者来说,几个子分类是主战场:
| 分类 | 主题 | 说明 |
|---|---|---|
| cs.LG | 机器学习 | 最宽的"总战场",覆盖面最大 |
| cs.CL | 计算语言学 / NLP | LLM 相关论文的主阵地 |
| cs.CV | 计算机视觉 | 多模态、文生视频也常在这里 |
| cs.AI | 人工智能 | 通用方法、Agent、推理 |
| stat.ML | 统计学习 | 理论向工作常发于此 |
每日更新量在数百篇量级,直接刷列表效率极低。实用的做法有三种:
- 跟作者与机构:在 arXiv 订阅你关注的学者(比如你精读过的论文的作者)的新提交,而不是刷全量列表。一个小团队持续产出,通常比随机看一百篇有价值得多。
- 用工具做筛选:Karpathy 早年做的 arXiv Sanity Preserver 提供按收藏与相似度排序的个性化推荐;Hugging Face Papers 每天按热度整理论文并附带代码、讨论;AlphaXiv 等工具可以直接在论文页面上提问。
- 只精读高信号论文:一篇论文值不值得精读,先看三点——题目是否回应你正在解决的问题、作者/机构是否有延续性、是否同时发布了代码与权重。
时间线经验
预印本永远快于会议:从投稿到发表往往隔 6–10 个月。2022 年 3 月投出的 Chinchilla 论文 2022 年 12 月才在 NeurIPS 出现,但它的影响力从预印本发布那天就开始了。读预印本、按会议查证版本,是研究者的标准节奏。
2. 评测与榜单:把"感觉"换成"数字"
单纯追论文会被叙事带偏——宣传稿总是报喜。对抗噪声的第二条管道是评测聚合站:
| 渠道 | 用途 | 特点 |
|---|---|---|
| Papers with Code | 按任务查 SOTA 榜单 | 每个基准的最高分、代码、论文一一对应,适合横向对比 |
| LMArena(原 Chatbot Arena) | 模型对战式人工评测 | 用人类盲测投票排序,至今仍是综合能力最可信的榜单一类 |
| Artificial Analysis | 推理成本 / 速度 / 质量对照 | 把"强不强"与"贵不贵"放在一起看,贴近工程决策 |
| HELM(斯坦福) | 多维度标准化评测 | 不止看准确率,还测偏差、鲁棒性、毒性,是学术向的标杆 |
评测站的局限也要知道:榜单总是滞后于发布、且容易被刷分污染。它的正确用法不是"谁第一就信谁",而是给你一个横向坐标,帮助判断一篇论文声称的提升是真实还是噪声——这部分方法与坑见前沿导航中的阅读方法,以及评测资源档案。
3. 学者与社区的信号
一线研究者的 X/Twitter 与博客,往往是"论文还没写出来"的观点与路线判断,是比论文更早的信号。值得长期关注的类型包括:
- 一线研究学者:Andrej Karpathy(架构与扩展、深度学习教育)、Yann LeCun(多模态与世界模型路线)、François Chollet(智能的测量)、Sebastian Ruder(NLP 综述与进展)、Colin Raffel(数据与扩散)、Thomas Wolf(Hugging Face 与开源生态)等。
- 实验室官方博客:OpenAI、Anthropic、Google DeepMind、Meta AI、DeepSeek 的 Research/Blog 板块,质量高于新闻媒体的二手报道。
- 开源社区:Hugging Face Hub 上的模型卡、开放权重模型的 Release Note(如 Llama、Mistral、Qwen 系列)是"技术方向"最直接的信号——开放权重模型的每一次发布,都是对整个生态的重定价。
信号 vs 噪声
X/Twitter 上的热度与重要性相关性不高:营销、情绪化辩论和标题党占大多数。建议把学者关注控制在 20 个以内,并只把他们的发言当作"待验证的假设",而不是结论。真正决定判断的,还是你自己读过的论文与复现过的实验。
4. 顶会:沉淀后的系统知识
顶会论文比预印本晚,但经过了同行评审,且会议有组织性的教程(Tutorial)与综述(Survey),是补系统知识的最佳入口:
| 会议 | 领域 | 每年大致时间 |
|---|---|---|
| NeurIPS | 机器学习(综合) | 12 月 |
| ICML | 机器学习 | 7 月 |
| ICLR | 表示学习 / 深度学习 | 4–5 月 |
| ACL / EMNLP | 自然语言处理 | 7 月 / 11 月 |
| CVPR / ICCV / ECCV | 计算机视觉 | 6 月 / 10 月 / 9 月(交替) |
追踪顶会不必参会:录用列表公布时扫一遍标题(通常会出一个"被接受的论文清单"),会议结束后在 ACL Anthology 或会议官网看 tutorial 材料即可。对于一个新人,一两个高质量 Tutorial 比五十篇论文管用,因为它们把该领域的坐标系讲清楚了。
把四条管道按"速度 × 深度"排列:
速度高 ┌────────────────────────────────────┐
│ X/博客、实验室动态 ── 信号,噪声最多 │
│ arXiv 每日更新 ── 一手论文 │
│ 评测榜 / HF 论文日报 ── 聚合 + 数字 │
│ 顶会论文与教程 ── 沉淀后知识 │
深度高 └────────────────────────────────────┘
读得越深,判断越稳;追得越急,越容易被带偏。二、六条研究主线
下面六条主线是当下最活跃、也最影响产业走势的方向。每条都给出现状、代表工作、关键问题,并按"论文名称(arXiv 号)→ 一句话要点"的方式引用,方便你在核心论文精读中对照精读。
主线一:大模型规模与效率
现状。 从 2018 年的 BERT(3.4 亿参数)到如今千亿参数规模的开源模型,参数量增长了三个数量级。但"越大越好"的朴素阶段已经过去,当下的关键词是效率:同样的算力怎么换来更多能力?同样的能力怎么花更少的推理成本?规模法则的叙事已经从"拼命加参数"转向"在约束下最优配置"。
代表工作。
| 工作 | 要点 |
|---|---|
| Scaling Laws for Neural Language Models(Kaplan et al., arXiv:2001.08361) | 损失随参数、数据、算力的幂律关系;早期结论偏"参数优先" |
| Training Compute-Optimal LLMs(Chinchilla, arXiv:2203.15556) | 修正规模法则:计算最优时参数与数据应等比例扩展(约每参数 20 个 token,如 70B 配 1.4T token) |
| Switch Transformer(arXiv:2101.03961)、Mixtral of Experts(arXiv:2401.04088) | MoE(混合专家):路由把每个 token 只送到少数专家,总参数量大而激活参数少,用稀疏激活换容量 |
| Distilling the Knowledge in a Neural Network(Hinton, arXiv:1503.02531);DeepSeek-R1 的蒸馏实验 | 蒸馏:把大模型的能力迁移到小模型,用小模型复现大模型的行为 |
| FlashAttention(arXiv:2205.14135)、QLoRA(arXiv:2305.14314) | 工程效率:IO 感知的注意力实现大幅提速;4-bit 量化微调让小团队也能在消费级显卡上做对齐 |
关键问题。
- 数据枯竭逼近:Chinchilla 定律告诉我们 token 要与参数同步涨,但高质量文本数据是有限的。规模化的下一个瓶颈已经从算力转移到了数据(详见主线六)。
- MoE 的成本转移:MoE 把"训练成本"变成了"部署成本"——所有专家都要驻留显存,路由不稳定、专家负载不均、批处理效率问题都是活跃研究点。稀疏化是否可持续,尚无定论。
- 推理效率决定产品形态:模型再强,如果单次推理太慢太贵就无法落地。蒸馏、量化、投机解码(speculative decoding)等"让大模型跑得更便宜"的技术,与"把模型做得更大"同等重要。
与你的关系
如果你做工程:这一线最相关的落地知识是 MLOps 与部署,见MLOps 概念页。如果你做研究:效率研究依然是有产出空间的洼地——它不依赖稀缺的算力,更依赖聪明的设计。
主线二:推理模型与思维链
现状。 2022 年"思维链(Chain-of-Thought)"提示让大模型显式写出中间推理步骤,打开了"通过引导显式推理提升能力"的大门。2024–2025 年,o1 与 DeepSeek-R1 把这条路线推向新的范式:在推理时花更多计算(test-time compute),模型自己"思考"更久,得到更好的答案——就像人类解题时打草稿、检查、重试。这被广泛视为从"预训练 + 提示"到"强化学习教推理"的转折点。
代表工作。
| 工作 | 要点 |
|---|---|
| Chain-of-Thought Prompting Elicits Reasoning in LLMs(arXiv:2201.11903) | 提示中给出推理示例,模型"想一步答一步",数学/常识推理显著提升 |
| Self-Consistency(arXiv:2203.11171)、Tree of Thoughts(arXiv:2305.10601) | 多次采样取多数投票 / 显式搜索思维树:用"多花计算"换更稳的推理 |
| Let's Verify Step by Step(OpenAI, arXiv:2305.20050) | 过程奖励模型:逐步验证每一步推理,比只看最终答案更可靠,是推理模型的技术先声 |
| o1 系列(OpenAI, Learning to Reason with LLMs,2024-09) | 大规模强化学习训练"思考型"模型:长思维链 + 测试时计算,数学/代码竞赛表现大幅跃升 |
| DeepSeek-R1(arXiv:2501.12948) | 公开权重复现 o1 路线:用 GRPO(DeepSeekMath, arXiv:2402.03300)做组内相对策略优化,纯 RL 涌现自我反思与长思考,并把推理能力蒸馏给小模型 |
| Scaling LLM Test-Time Compute Optimally(arXiv:2408.03314)、Large Language Monkeys(arXiv:2407.21787) | 理论化"测试时计算 vs 模型参数"的取舍:对可验证任务,多花推理算力可能比增大模型更划算 |
关键问题。
- 测试时计算的成本账:o1/R1 的"想得久"意味着推理成本数十倍上升。哪些任务值得花、怎么自适应分配思考时间,是工程上的核心问题。
- 开放式任务的奖励信号:强化学习需要可验证的答案(数学、代码)。对于写作、规划、开放问答,如何构造过程奖励依然开放——这也是 R1 论文自己承认的局限。
- "思考"的透明度:思维链真的在"推理"吗?还是另一种模式匹配?这类模型内部机制的解释见可解释性概念页。可以确定的是,这条主线会持续放大"推理能力"与"事实可靠性"的张力——详见第三节的幻觉问题。
主线三:多模态统一
现状。 视觉与语言的统一经历了两个阶段:先是双塔对齐(CLIP 把图像与文本嵌入到同一空间),再是生成式多模态大模型(把图像当作 token 输入解码器,如 BLIP-2、LLaVA、GPT-4V)。2024 年起,扩散模型与 Transformer 的结合(DiT)把"生成"扩展到了视频:Sora 以"世界模拟器"为名展示了一致性惊人的文生视频能力。多模态正在从"能看图说话"走向"理解与生成时空连续的世界"。
代表工作。
| 工作 | 要点 |
|---|---|
| ViT(arXiv:2010.11929)、CLIP(arXiv:2103.00020) | Transformer 直接吃图像 patch;图文对比学习得到统一语义空间 |
| Flamingo(arXiv:2204.14198)、BLIP-2(arXiv:2301.12597) | 用少量可训练连接层把预训练视觉编码器接入语言模型,低成本获得视觉对话能力 |
| LLaVA(arXiv:2304.08485) | 指令微调路线:用 (图像, 问题, 回答) 数据把视觉特征与语言模型对齐,开源 VLM 的基准线 |
| GPT-4V(System Card,2023-09) | 首个面向公众的强视觉语言模型,展示 OCR、图表理解、指代定位等能力,也暴露幻觉与隐私问题 |
| Scalable Diffusion Models with Transformers(DiT, arXiv:2212.09748);Sora(Video generation models as world simulators,2024-02);Stable Video Diffusion(arXiv:2311.15127) | Transformer 化的扩散模型把文生图推进到文生视频;Sora 声称的"涌现"是真实物理规律的近似学习,还是数据插值,仍在争论 |
关键问题。
- 对齐的深度:VLM 的"理解"很多停留在语义对齐(能说"这是什么"),离像素级理解(精确空间关系、计数、物理直觉)还很远。
- 视频的物理一致性:Sora 类模型生成的视频在物体持久性、交互物理上仍会崩塌——"世界模型"叙事是否成立,取决于能否稳定地建模因果与物理规律。
- 评估与方法论:多模态模型能力边界模糊,评测基准(如幻觉率、指令跟随)还在快速演进中。生成式模型的基础机制见生成式模型概念页,扩散模型家族的精读见扩散模型案例。
对读者的定位
多模态是"视觉 / 语言 / 生成"三拨人的汇合点。如果你有 CV 背景,VLM 是迁移成本最低的高价值入口;如果你做生成,文生视频是从图像到视频的自然延伸。
主线四:AI Agent 与工具使用
现状。 模型从"回答问题"走向"执行任务":给定目标,模型自己规划步骤、调用工具(搜索、代码、浏览器、数据库)、观察结果、修正策略,循环往复直到完成。这个**"规划—行动—观察"循环**是 2023 年以来最热的工程方向。与此同时,传统 RAG(检索增强生成)进化成了 Agent 的"记忆与外部知识"组件;而 MCP(Model Context Protocol)这样的开放协议,正在把"模型如何连接外部世界"标准化。
代表工作。
| 工作 | 要点 |
|---|---|
| ReAct: Synergizing Reasoning and Acting in LLMs(arXiv:2210.03629) | 推理与行动交替:Thought → Action → Observation 循环,Agent 的架构原型 |
| Toolformer(arXiv:2302.04761)、Gorilla(arXiv:2305.15334) | 让模型自己学习何时调用什么 API;大规模 API 调用与检索式工具选择的代表 |
| Retrieval-Augmented Generation(arXiv:2005.11401)、Self-RAG(arXiv:2310.11511) | RAG 从"检索—拼接—生成"进化到"边生成边自我检索与批判";RAG 评测见 RAGAS(arXiv:2309.15217) |
| AgentBench(arXiv:2308.03688)、Agent 综述(arXiv:2309.07864) | Agent 能力评测(操作系统、数据库、网页任务)与架构分类(规划/记忆/工具/反思) |
| MCP 协议(modelcontextprotocol.io,Anthropic 2024-11 开源) | 为"模型 ↔ 工具/数据源"定义统一协议,类似"AI 世界的 USB-C 接口",已被多家主流框架与工具采纳 |
关键问题。
- 可靠性:Agent 的每一步都有误差,长任务的错误累积导致成功率随步数指数下降。评测(WebArena 类)显示即使最强模型在真实网页任务上成功率仍低。
- 状态与记忆:长会话的状态管理、跨工具的状态一致性、记忆的持久化与遗忘,都还没有干净的解决方案。
- 安全与权限:当模型能调工具、能执行代码,越狱的后果就从"说错话"升级为"做错事"。权限最小化、审计、可回滚,是 Agent 上生产前必须补的功课。
- 协议与生态:MCP 出现前各家自造工具调用格式;协议标准化能降低集成成本,但也带来"接口稳定但智能不保证"的新问题。
主线五:对齐与安全
现状。 对齐(Alignment)解决的是"模型有能力但不一定听你的、不一定是对的"的问题。技术路线经历了三代:RLHF(人类反馈强化学习) → 偏好优化(DPO 等更简单的替代) → 可扩展监督(AI 反馈、宪法 AI)。同时,"越狱—防御"的攻防博弈与机制可解释性(试图搞清模型内部发生了什么)构成了安全的另一半。这条主线从"模型的附加件"变成了"模型能力的一部分"——因为能力越强,行为失控的代价越大。
代表工作。
| 工作 | 要点 |
|---|---|
| Training Language Models to Follow Instructions with Human Feedback(InstructGPT, arXiv:2203.02155) | RLHF 三阶段(SFT → 奖励模型 → PPO 优化),ChatGPT 类产品的技术基础;偏好学习的强化学习原理见强化学习概念页 |
| Direct Preference Optimization(DPO, arXiv:2305.18290) | 免训练奖励模型:直接用偏好对做监督式优化,RLHF 的更便宜替代,衍生出 IPO、KTO 等一批变体 |
| Constitutional AI(arXiv:2212.08073)、RLAIF(arXiv:2309.00267) | 用 AI 反馈代替人类反馈、用宪法规则自我修正,把对齐从"大量人工标注"中解放出来 |
| Universal and Transferable Adversarial Attacks(GCG, arXiv:2307.15043);SmoothLLM(arXiv:2310.03684) | 越狱攻击可以自动化、可迁移;防御(扰动平滑等)目前仍以补丁式为主 |
| Towards Monosemanticity(Anthropic, Transformer Circuits) | 机制可解释性:用字典学习找出模型中语义清晰的特征,试图把"黑箱"拆成可理解的部分 |
关键问题。
- 对齐税(alignment tax):对齐往往以牺牲能力为代价,或至少难以证明"对齐不损能力"。能不能既强又听话,是持续争论。
- 评测对齐效果:红队测试、对抗性评测永远落后于攻击。对齐不是一个可一次性完成的产品特性,而是一个持续的对抗过程。
- 可解释性的距离:目前的机制可解释性主要在小型模型上取得进展,离"解释千亿参数的决策"还非常远;它更像望远镜而非显微镜。可解释性的完整图景见可解释性概念页。
- 安全的层级:从"不回答有害问题"到"在开放 Agent 中不执行有害操作"再到"可证明的安全保证",每一层都是尚未解决的开放问题。
主线六:数据工程
现状。 大模型时代常说"模型是算法,数据是燃料",但更准确的说法是:当算法趋同(都是 Transformer + RL),数据质量成了能力差异的主要来源。这条主线包括三大块:数据筛选(从网页抓取物中清洗出高质量语料)、合成数据(用模型生成训练数据,摆脱人类数据上限)、数据合规(版权与隐私的法律与工程约束)。DeepSeek-R1 论文中"用纯 RL + 精选冷启动数据"的路线,再次把数据质量推上了台面。
代表工作。
| 工作 | 要点 |
|---|---|
| The RefinedWeb Dataset(Falcon, arXiv:2306.01116) | 仅用公开网页(Common Crawl)做重度清洗,就能训出强模型——清洗流程本身是可复用的方法 |
| Deduplicating Training Data Makes Language Models Better(arXiv:2107.06499) | 去重不仅省算力还提升性能与鲁棒性,是数据管线的必备步骤 |
| Textbooks Are All You Need(phi-1, arXiv:2306.11644) | 用"教科书级"合成数据 + 少 token 训出强代码模型:合成数据质量可以替代规模 |
| LIMA: Less Is More for Alignment(arXiv:2305.11206) | 1000 条高质量对齐数据即可显著改变行为——数据质量对数量的一记重锤 |
| Synthetic Data from Diffusion Models Improves ImageNet Classification(arXiv:2304.08466) | 生成图像用于训练:合成数据进入视觉主流管线 |
| The Curse of Recursion(arXiv:2305.17493) | 模型坍缩(model collapse):在自生成数据上训练的模型会逐步退化——合成数据的红线 |
| Datasheets for Datasets(arXiv:1803.09010);EU AI Act(EUR-Lex);US Copyright Office AI 报告(copyright.gov/ai) | 数据文档化实践与版权合规的制度框架 |
关键问题。
- 数据枯竭与模型坍缩:人类生成的高质量文本接近上限,而完全依赖合成数据有退化风险。"真实数据 + 合成数据"的最优配比是当前最热的开放问题之一。
- 筛选还是生成? 同一笔预算,是花在清洗更多真实数据,还是用模型生成"教科书式"数据?两条路线各有拥趸,目前没有统一答案。
- 版权合规:训练数据中的版权内容如何认定、模型输出与训练数据的版权边界如何划分,各国监管仍在博弈(EU AI Act 要求训练数据透明度,美国版权局的立场也在演化)。这不是纯技术问题,却是每个团队都要面对的现实约束。
三、哪些问题还没解决
上面每条主线都有"关键问题",但有几个问题是跨主线的、被反复提到却远未解决的。诚实面对它们,比追逐热点更重要。
1. 幻觉:知识型系统的阿喀琉斯之踵
大模型会以极高的流畅度编造事实。幻觉的类型学与成因分析见 A Survey on Hallucination in LLMs(arXiv:2311.05232):分为事实性幻觉(说的不是真的)与忠实性幻觉(说的与上下文不符)。工程上目前只有"缓解"而谈不上一劳永逸的"消除",手段包括:RAG(把回答绑定到可核验的检索来源)、工具调用(让模型查数据库而非凭空生成)、引用与归因(强制给出出处)、置信度校准(让模型对不确定的问题直接说"不知道",而不是编一个答案)、以及场景约束(医疗、法律等高风险用途限制模型生成)。这些手段各自有效、都治标不治本,学术界甚至没有对"幻觉是否在原则上可消除"达成共识。当一个系统会被要求"创造",它就不可能天然区分"创造"与"编造"——这是生成模型的结构性矛盾。
2. 长程推理与真正的理解
推理模型在数学竞赛、代码题上惊艳,但长程规划、长期记忆、跨多步骤的一致性仍然脆弱。更根本的问题是:目前模型的"推理"多大程度是模式匹配,多大程度是真正的组合式理解? 这个问题没有定论,而这直接决定了模型能力的上限。测试时计算的收益曲线(参见 Scaling LLM Test-Time Compute)也显示:对不可验证的开放式任务,"想得更久"未必更准。
3. 评估的缺失
当前评估有三大缺陷:
- 基准饱和:MMLU、GSM8K 等经典基准已被刷到接近天花板,新基准(如 BIG-Bench Hard, arXiv:2210.09261)在被攻克后又会快速饱和。
- 数据污染:预训练语料可能已经包含评测集("背过答案"的模型得分虚高),检测污染是活跃但未解决的问题。
- LLM 做裁判的偏置:用大模型给大模型打分(LLM-as-a-judge)高效但带有系统性偏置(偏好更长、更流畅的回答),其可靠性仍在争论中。
评测理论化的工作(如 HELM, arXiv:2211.09110)提供了框架,但**"我们到底在测什么、测出来的数字意味着什么"依然是开放的**。
4. 其他长期未解问题
- 持续学习:模型学会新任务后遗忘旧任务(灾难性遗忘)没有通用解法,微调即遗忘是日常痛点。
- 世界模型与因果:"模型内部是否建立了对世界的因果表征"尚无定论,Sora 的争论是缩影。
- 可证明的安全:目前所有安全措施都是经验性的,没有形式化保证。
如何与"未解决"相处
不要把"还没解决"等同于"没有机会"。恰恰相反:真正高价值的产出通常出现在公认难题的边角。幻觉催生了 RAG 与工具使用的繁荣,评估缺陷催生了整个评测产业。理解了问题清单,你就理解了机会清单。
四、给读者的建议:如何选择深耕方向
面对六条主线,最常见的困惑是"该选哪个"。给三条原则:
原则一:按"你的不可替代性"选,不按"热度"选。 六条主线都很热,但你的背景决定了哪条路的上手成本最低、护城河最深:
| 你的背景 | 切入方向 | 理由 |
|---|---|---|
| 算法/建模基础好 | 主线二(推理模型) | 少数据、重设计,靠理解力而非算力取胜 |
| 工程/系统基础好 | 主线一(效率)或主线四(Agent) | 效率与 Agent 落地都是工程密集区,代码能力即优势 |
| CV/视觉背景 | 主线三(多模态) | 从 VLM 迁移成本最低,视频是增量最大的领域 |
| 有产品/安全敏感行业经验 | 主线五(对齐与安全) | 稀缺的"懂业务又懂模型"复合位置 |
| 数据基建/合规背景 | 主线六(数据工程) | 所有团队的刚需,且越往后越值钱 |
| 尚不确定 | 先读前沿地图与核心论文精读 | 用一两个月建立全貌再决定,别急着押注 |
原则二:深耕一个方向"到能独立做项目",再横向扩展。 前沿最大的陷阱是"每篇论文都读一遍、哪个方向都浅尝"。更有效的模式是:
- 选一个方向,把它的经典论文(见核心论文精读)按时间顺序精读十到二十篇,画出一张技术演进图;
- 用开源权重复现至少一个代表工作(哪怕是缩小版),把论文里的"做法"变成你手上的"能力";
- 在 Hugging Face、GitHub 上参与一个活跃项目(提 issue、修 bug、复现实验),让真实反馈校准你的理解;
- 用资源档案里的工具与榜单持续跟踪这个方向的进展,写周期性的个人综述。
原则三:警惕叙事,拥抱数字。 前沿写作充满了"颠覆""超越人类"的叙事,但它们很少经得起下个月的检验。你的防御武器是评测与复现:任何"大突破",都先在评测站找数据,再跑一个小实验验证。判断"什么会留下、什么会退潮",比预测"下一个热点"更可靠。
一年的深耕时间线(参考)
如果决定深耕一个方向,一个可执行的一年框架是:第 1–3 个月把该方向经典论文精读一遍并复现至少一个缩小版实验,建立自己的代码基座;第 4–6 个月独立完成一个小项目(复现 + 一项自己的改进),并写成一份技术报告;第 7–9 个月参与一个开源项目或公开评测,让社区反馈校准你的判断;第 10–12 个月把成果整理成可展示的形式(博客、报告、参赛成绩)。一年后你收获的不是"读过很多论文",而是一条能独立走通"读论文—做实验—形成判断"的回路——这比任何知识量都值钱。
给新人的时间预算
如果每周能投入 10 小时:5 小时精读与复现、3 小时跟踪(arXiv + 评测榜 + 学者动态)、2 小时写笔记与总结。三个月后你会明显感觉到:判断力比记忆量大得多。完整的学习路径规划见学习路径与前沿导航。
五、延伸阅读
- 前沿导航 —— 本站论文板块入口,含检索与阅读方法
- 前沿地图 —— 用一张图把握六大主线的位置关系
- 核心论文精读 —— 本文引用的关键论文的精读版本
- 常见问题 —— 关于论文阅读与研究方向的高频问答
- 大语言模型案例 —— LLM 的原理、训练与演化全景
- 扩散模型案例 —— 文生图/文生视频的模型家族
- 生成式模型概念 —— 生成式模型的基础机制
- 强化学习概念 —— 理解 RLHF 与推理模型 RL 训练的前提
- MLOps 概念 —— 大模型的工程化、部署与监控
- 可解释性概念 —— 机制可解释性与对齐安全的关系
- 资源与工具档案 —— 追踪前沿所需的全部工具清单
参考资料
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(arXiv:2501.12948) —— 推理模型代表工作,公开权重
- Training Compute-Optimal Large Language Models(Chinchilla, arXiv:2203.15556)
- Scaling Laws for Neural Language Models(arXiv:2001.08361)
- Switch Transformers: Scaling to Trillion Parameter Models(arXiv:2101.03961)
- Mixtral of Experts(arXiv:2401.04088)
- Distilling the Knowledge in a Neural Network(arXiv:1503.02531)
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness(arXiv:2205.14135)
- QLoRA: Efficient Finetuning of Quantized LLMs(arXiv:2305.14314)
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(arXiv:2201.11903)
- Self-Consistency Improves Chain of Thought Reasoning in Language Models(arXiv:2203.11171)
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models(arXiv:2305.10601)
- Let's Verify Step by Step(arXiv:2305.20050)
- OpenAI. Learning to Reason with LLMs(o1 系列博客)
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models(GRPO, arXiv:2402.03300)
- Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters(arXiv:2408.03314)
- Large Language Monkeys: Scaling Inference Compute with Repeated Sampling(arXiv:2407.21787)
- OpenAI. GPT-4V(ision) System Card
- OpenAI. Video Generation Models as World Simulators(Sora 技术报告)
- Scalable Diffusion Models with Transformers(DiT, arXiv:2212.09748)
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets(arXiv:2311.15127)
- Learning Transferable Visual Models From Natural Language Supervision(CLIP, arXiv:2103.00020)
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders(arXiv:2301.12597)
- Visual Instruction Tuning(LLaVA, arXiv:2304.08485)
- Flamingo: a Visual Language Model for Few-Shot Learning(arXiv:2204.14198)
- ReAct: Synergizing Reasoning and Acting in Language Models(arXiv:2210.03629)
- Toolformer: Language Models Can Teach Themselves to Use Tools(arXiv:2302.04761)
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(arXiv:2005.11401)
- Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection(arXiv:2310.11511)
- RAGAS: Automated Evaluation of Retrieval Augmented Generation(arXiv:2309.15217)
- AgentBench: Evaluating LLMs as Agents(arXiv:2308.03688)
- Model Context Protocol 官方文档(modelcontextprotocol.io)
- Training Language Models to Follow Instructions with Human Feedback(InstructGPT, arXiv:2203.02155)
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model(arXiv:2305.18290)
- Constitutional AI: Harmlessness from AI Feedback(arXiv:2212.08073)
- Universal and Transferable Adversarial Attacks on Aligned Language Models(arXiv:2307.15043)
- Anthropic. Towards Monosemanticity: Decomposing Language Models With Dictionary Learning(Transformer Circuits)
- The RefinedWeb Dataset for Falcon LLM(arXiv:2306.01116)
- Deduplicating Training Data Makes Language Models Better(arXiv:2107.06499)
- Textbooks Are All You Need(phi-1, arXiv:2306.11644)
- LIMA: Less Is More for Alignment(arXiv:2305.11206)
- The Curse of Recursion: Training on Generated Data Makes Models Forget(arXiv:2305.17493)
- A Survey on Hallucination in Large Language Models(arXiv:2311.05232)
- Holistic Evaluation of Language Models(HELM, arXiv:2211.09110)
- Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them(BIG-Bench Hard, arXiv:2210.09261)
- arXiv(cs.LG / cs.CL 最新提交)
- arXiv Sanity Preserver(arxiv-sanity.com)
- Hugging Face Papers(huggingface.co/papers)
- Papers with Code(paperswithcode.com)
- LMArena(lmarena.ai)
- ACL Anthology(aclanthology.org)
- Regulation (EU) 2024/1689(EU AI Act, EUR-Lex)
- U.S. Copyright Office: Copyright and Artificial Intelligence