入门 AI 科研:从选题、复现到写出第一篇论文
很多人把「做科研」想得很玄,似乎要先有惊世骇俗的灵感。真实的第一篇论文往往没那么戏剧化,它更像是把「一个清楚的问题、一组可复现的实验、一份讲明白的稿件」组合起来。本文按时间顺序,带你走完从找方向、读文献、做实验到投稿的完整路径。文中标注「已核验」的内容来自相关平台官网;具体课程与社区链接可能随时间变化,标注「待核实」,请你自行确认最新地址。
科研不是比谁聪明,而是比谁更会把模糊的想法变成可检验、可复现、可讲述的结果。
一、找到研究方向与选题
选题决定了后面半年你的痛苦程度。好选题不一定宏大,但一定要满足三个基本条件。
第一,问题要可验证。能用实验给出「方法 A 比方法 B 在指标 X 上更好/更差」这样的结论,而不是停留在观点层面。第二,要有明确增量。哪怕只是把一个已有方法换了个更稳的初始化、或在更小数据上验证了某个假设,只要说清「相比已有的工作,我多做了什么」,就是有效增量。第三,资源要可行。入门阶段选一个能在你手头 GPU(甚至 Colab)上跑通的课题,比选一个需要 64 卡集群的课题现实得多。
几个具体的选题来源:
- 从复现出发。挑一篇你感兴趣的方向里的经典或近期论文,把它跑通,在复现过程中你自然会看到它的弱点(训练不稳、对数据分布敏感、计算贵),这些弱点就是选题的入口。
- 从综述与基准出发。读一篇好的综述,看它总结的「开放问题」一节;或盯着一个公开基准(benchmark)排行榜上长期没人攻克的子任务。
- 从你自己的使用痛点出发。你用某个模型时遇到的具体失败案例,往往就是一个小而真实的研究问题。
选题时避免两个极端:一是追热点追到只剩「换个数据集再跑一遍」,没有自己的问题意识;二是选一个完全没有前人工作、也无从比较的方向,导致最后无法评估自己的结果。
二、高效读论文:三遍法与持续追踪
读论文的质量,直接决定你选题和方法的水平。推荐采用经典的「三遍法」(Srinivasan Keshav 在《How to Read a Paper》中系统总结),它强调带着不同目标分轮次读,而不是从头到尾逐字啃。
- 第一遍, skim(扫读):看标题、摘要、引言、各级小标题、图表和结论,忽略数学与实现细节。目标是判断「这篇和我相关吗、它大致做了什么」,五到十分钟就能完成。
- 第二遍, grasp(理解):细读但不抠证明,用荧光笔标出关键假设、算法主干和实验设置,尝试在脑中复述作者的方法路线。目标是能向别人讲清「它为什么 work、在哪些条件下 work」。
- 第三遍, reconstruct(重建):合上论文,尝试自己推导出核心公式或伪代码;再打开论文对照,找出你漏掉的关键细节。目标是达到能复现、能挑刺的程度。
读的时候一定要留下「阅读卡」(可配合本系列《科研工具链:Zotero 与 Obsidian 高效组合》那篇的模板),固定记录:一句话结论、研究问题、方法要点、与你课题的关系、待跟进问题。否则读一百篇,两周后也只剩模糊印象。
追踪新论文比囤论文更重要。常用渠道:
- arXiv:计算机科学下的 cs.LG(机器学习)、cs.CL(计算与语言)、cs.CV(计算机视觉)、stat.ML(统计机器学习)等分类每天都有新帖。已核验(arXiv 官网分类列表包含这些类别,提交入口见 info.arxiv.org/help/submit)。
- Papers With Code:把论文、代码与 SOTA 排行榜绑在一起,便于边追新论文边看「该任务目前最强方法是什么、有无公开代码」。该站点本次未通过官网直接核验,具体栏目以官网实时内容为准,标注「待核实」。
- Google Scholar 邮件提醒、Semantic Scholar、以及你所在子领域的邮件列表,用来补 arXiv 之外的期刊与会议论文。
典型的新帖追踪流程如下,注意它描述的是信息流而非可执行命令:
订阅 arXiv 分类 RSS / 邮件
(cs.LG、cs.CL、cs.CV 等)
每天 skim 新帖标题与摘要
(用三遍法的第一遍快速筛选)
命中相关论文,导入 Zotero 并建阅读卡
(第二、三遍精读后补全)
在 Papers With Code 看对应任务的 SOTA 与代码
(判断该方法是否已被超越、能否复现)
三、复现与做实验:把混乱变成可管理的记录
科研的可信度来自可复现。入门阶段最该先做的,是复现一篇 baseline 论文:把它的指标在你的环境里跑出来。能复现,才有资格说「我的改进比它好」。
实验一旦变多,人脑就记不住了:哪次用了什么学习率、第几版数据增强、随机种子是多少、为什么这次指标掉了一截。必须用实验管理工具把「参数、指标、产物、环境」统一记下来。
用 Weights & Biases 跟踪实验
Weights & Biases(W&B)是面向实验跟踪、评估与可观测性的平台,提供试验跟踪、超参扫描(sweeps)、模型注册表等能力。已核验(W&B 官方文档将其定位为 experiment tracking、evaluation、observability 平台,W&B Models 涵盖 experiment tracking、fine-tuning、sweeps、model registry)。最小用法如下:
import wandb
# 初始化一次 run,指定项目名
wandb.init(project="my-first-paper", name="exp_lr1e-3")
# 记录超参与每轮指标
config = {"lr": 1e-3, "batch_size": 64, "seed": 42}
wandb.config.update(config)
for epoch in range(10):
loss = train_one_epoch(epoch)
acc = eval_one_epoch(epoch)
wandb.log({"loss": loss, "acc": acc, "epoch": epoch})
# 训练结束退出,所有曲线与配置自动同步到云端面板
wandb.finish()
用 MLflow 管理实验与模型
MLflow 是开源的机器学习生命周期平台,由 Linux Foundation 背书,核心包含实验跟踪(Tracking)、项目(Projects)、模型(Models)与模型注册表(Model Registry)等模块。已核验(官网说明其由 Linux Foundation 背书、开源五年以上,并提供 mlflow server 一键启动;文档列出与 PyTorch、Hugging Face 等框架的集成)。最小用法如下:
import mlflow
mlflow.set_tracking_uri("http://localhost:5000")
mlflow.set_experiment("my-first-paper")
with mlflow.start_run(run_name="exp_lr1e-3"):
mlflow.log_param("lr", 1e-3)
mlflow.log_param("batch_size", 64)
mlflow.log_param("seed", 42)
for epoch in range(10):
loss = train_one_epoch(epoch)
acc = eval_one_epoch(epoch)
mlflow.log_metric("loss", loss, step=epoch)
mlflow.log_metric("acc", acc, step=epoch)
# 把训练好的模型登记到模型注册表,便于复现与部署
mlflow.pytorch.log_model(model, "model")
两者取向略有不同:W&B 偏「团队协作与可视化面板」,开箱即用体验好;MLflow 偏「开源、可自托管、对接现有 MLOps 流水线」。入门不必二选一,先挑一个用顺手,把实验记全比选哪个工具更重要。
四、写与投稿第一篇论文
写作:从 LaTeX 开始
AI 顶会几乎都用 LaTeX。第一次写,直接套用目标会议的官方模板(如 ACL、NeurIPS、ICLR 的 latex 样式文件),能省掉大量排版纠结。一篇标准论文的结构是:摘要、引言(讲清问题与贡献)、相关工作、方法、实验、结论。新手最容易犯的错误是「方法写得很满、贡献讲不清楚」,一定要在引言用三到五条 bullet 明说「本文相对已有工作多做/改了什么」。
\documentclass{article}
\begin{document}
\title{我的第一篇论文标题}
\author{你的名字}
\maketitle
\begin{abstract}
这里用三句话讲清:问题是什么、我们做了什么、结果如何。
\end{abstract}
\section{Introduction}
我们的贡献如下:
\begin{itemize}
\item 我们提出了一个更稳的初始化方法,在 X 数据集上提升 2 个点。
\item 我们首次在小样本设定下验证了该假设。
\end{itemize}
\end{document}
投稿流程:以 OpenReview 为例
OpenReview 是一个面向开放同行评审的云平台,提供可配置的评审流程、开放获取与开放讨论,且提交与阅读论文均免费。已核验(OpenReview 官网说明其目标是促进评审过程的开放性,提供 open peer review、open access、open discussion 等能力,且论文提交免费)。ICLR 等会议采用它作为投稿系统,典型流程是:
- 提交(Submission):双盲审稿下需隐去作者信息,附 PDF 与补充材料。
- 评审(Review):分配审稿人给出分数与意见,部分会议开放公开评论。
- 反驳(Rebuttal):作者针对审稿意见逐条回应,补充实验或澄清误解。
- 终审与录用(Camera-ready):根据讨论结果决定录用,录用后提交最终版。
各会议具体时间线与双盲细则不同,投稿前务必读该会议当年的 Call for Papers。下面用文字描述这个循环:
选题与复现 baseline
(确认有可验证的增量)
写稿并内部预讲(lab meeting / 同学互审)
(提前暴露逻辑漏洞)
在 OpenReview 提交双盲稿件
(按会议模板与页数限制)
回应审稿意见(rebuttal)
(用新实验和数据说话,而非争辩)
录用后提交 camera-ready,并发布 arXiv 预印本
预印本:arXiv 的使用
arXiv 是开放获取的预印本平台,1991 年由 Paul Ginsparg 创立,长期由康奈尔大学托管、后成为独立非营利组织,提交论文免费且不经过同行评审,仅做主题与学术性审核。已核验(arXiv 官网 About 页面说明其 1991 年创立、提交免费、内容不经同行评审而由志愿者审核)。常见做法是在会议投稿前后(注意部分会议对「同时投稿」有规定)将稿件发布为预印本,扩大可见度并固定时间优先权。发布时选对分类(如 cs.LG)并认真填写摘要即可。
五、推荐学习资源与社区
入门阶段,系统课程比零散刷帖更提效。以下链接的有效性可能随时间变化,标注「待核实」,请自行确认:
- 经典机器学习与深度学习基础:各校公开课程(如深度学习专项课程、机器学习导论),具体主页地址待核实。
- 论文写作与评审:会议官网的 Author Guidelines 与往年录用论文,是最直接的范本,链接待核实。
- 社区:所在子领域的邮件列表、实验室组会、以及论文讨论论坛,用于获取反馈与找合作者,具体入口待核实。
更稳的做法是「以一篇你想复现的论文为锚点」:把它引用的关键文献、代码仓库与对应基准全部吃透,比泛泛列书单更有用。
小结
- 选题要满足可验证、有增量、资源可行三个条件,最现实的入口是从复现经典论文的弱点出发。
- 读论文用三遍法分层推进,并坚持写阅读卡;用 arXiv 分类与 Papers With Code 等渠道持续追踪新进展(后者具体栏目待核实)。
- 实验必须用工具管理:W&B 与 MLflow 都能记录参数、指标与模型,先选一个用顺、把实验记全比挑工具更重要(两者能力均已核验)。
- 写作从 LaTeX 官方模板起步,投稿以 OpenReview 的双盲流程为例走完提交、评审、反驳、录用,并用 arXiv 预印本固定优先权(相关平台事实已核验)。
- 第一篇论文的目标是完整跑通科研循环,而不是一步到位做出重大突破。
参考与延伸阅读
- arXiv 官网(分类列表、提交入口、1991 年创立与免费提交等事实,已核验):https://arxiv.org
- arXiv About 页面(创立背景、非营利与审核机制,已核验):https://info.arxiv.org/about
- OpenReview 官网(开放评审定位、免费提交与开放讨论等事实,已核验):https://openreview.net
- OpenReview About 页面(平台目标与能力说明,已核验):https://openreview.net/about
- Weights & Biases 文档(实验跟踪、sweeps、model registry 等定位,已核验):https://docs.wandb.ai
- MLflow 官网(Linux Foundation 背书、开源与实验跟踪等事实,已核验):https://mlflow.org
- Papers With Code(论文、代码与 SOTA 排行榜聚合,本次未通过官网直接核验,待核实):https://paperswithcode.com
- 三遍读法原始文献:Srinivasan Keshav, How to Read a Paper(方法框架,建议自行检索最新版本,待核实)