先问材料在哪里
AI 研究最容易浪费时间的地方,常常是工具和来源边界错位。查一项刚公布的政策,需要开放网页和当前信息;比较一批论文的样本、方法与结论,需要结构化抽取;公司内部报告限定在批准材料内,搜索范围越大反而越危险。界面都像聊天框,背后的检索范围和证据路径却差得很远。
页面挂出十几个来源,也不能直接回答这段文字是否可靠。至少要分别检查:链接是否覆盖了主要陈述,原文是否支持附近的句子,以及来源本身是否适合支撑这项结论。一项 2023 年针对早期生成式搜索系统的审计 已把这些问题拆开讨论;它只能说明核验方法,不能拿来评价 2026 年产品的当前表现。
- 开放网页快速摸清议题:Perplexity
- 跨网页、文件和不同来源形成长报告:ChatGPT Deep Research
- 只依据指定材料回答:Gemini Notebook(NotebookLM)
- 把论文筛选与证据提取做成表格:Elicit
- 快速回答科学问题并定位论文依据:Consensus
- 查看一篇论文后来被怎样引用:Scite
- 从种子论文扩展文献网络:ResearchRabbit
- 在同一学术工作区搜索、阅读和整理:SciSpace
这八款工具没有统一准确率排名。本文也没有用同一套题目做受控测试。“最佳”只表示某个研究环节更匹配;最终选择仍要落到资料范围、证据粒度、导出方式和复核成本上。更多同类产品可在 AI 效率工具目录 中继续筛选。
这份名单按六件事筛选
第一项是来源边界。工具检索开放网页、学术语料,还是用户上传的文件,决定了它能回答什么,也决定了遗漏会藏在哪里。第二项是证据粒度:答案只列参考资料,还是能回到具体引文、章节或引用语境。
第三项看它在流程中的角色。发现论文、筛选论文、抽取字段、检查后续引用和综合报告各是不同工作,功能多并不自动带来更好的方法。第四项看导出与记录能力,研究产物若离开平台便无法复查,团队协作会很快卡住。
第五项是免费入口和付费门槛,第六项是公开限制。本文的价格、额度和产品状态均核验于 2026 年 9 月 30 日。促销、地区价格和按计算量变化的额度随时可能调整,付费前应以账户内页面为准。
入选产品还须满足三个条件:仍在运营,研究是主要使用场景,官方资料能确认其来源或证据处理方式。通用聊天机器人、纯参考文献管理器和传统索引数据库没有放进同一张表;它们各有价值,但承担的任务不同。
查开放网页:快问与深挖是两种工作
Perplexity:先找到方向和初始来源
面对陌生行业、当前事件或跨网站信息,Perplexity 的优势是低摩擦。输入问题后得到带来源回答,再沿着追问缩小范围,很适合在研究早期建立关键词、参与者和待查问题清单。
免费 Standard 方案提供近乎不限量的 basic searches。官方方案页在核验时列出,免费用户每天有 3 次 Pro Search、每月 1 次 Research query;这些额度可能变化。Pro 提高 Pro Search、Research、模型选择与文件上传额度,官方把 Pro Search 定位为多步骤、细节较多的查询。本轮可访问的官方页面没有给出稳定的个人 Pro 标价,因此不补写月费。
但是,开放网页把搜索引擎里的质量差异一起带进答案。关键数字要打开原文,核对作者、发布日期和统计口径;二手转载与原始公告同时出现时,优先保留原始材料。更多引用只增加检查入口,不代表相邻陈述已经得到支持。
ChatGPT Deep Research:需要一份可审阅的综合报告
研究问题涉及网页、论文、内部文件和方法文档,且交付物是一份有结构的长报告,ChatGPT Deep Research 更合适。OpenAI 的官方指南要求在请求中写明问题、范围、所需结果以及相关文件或上下文;这几项约束越具体,后续核查越容易。
它能把材料组织成主题、分歧、限制、与来源相连的证据基础,以及仍待确认的说法。适合市场进入研究、政策变化追踪或跨来源技术调查。当前官方 Learn 页面不足以确认统一的价格和用量,实际可用性取决于账户与工作区方案。
它的代价是检查面更大。提示中应提前限定允许的来源、时间范围、交付格式和引用要求,报告完成后再逐条回到原始来源。来源发现和模型解释要分开记录,读者才能看出哪一句来自材料,哪一句属于综合判断。
两者的选择不必围绕模型强弱。20 分钟内摸清一个议题,Perplexity 更直接;问题跨多类来源,还要交付章节清楚的调查报告,Deep Research 更顺手。两种场景都需要人工核验,只是检查量和输出形态不同。
材料已经选好:让 Gemini Notebook 守住范围
很多研究任务并不欢迎额外网页信息。客户访谈、课程材料、尽调文件或已筛选论文,往往要求回答严格来自批准资料。Gemini Notebook 是 Google 当前帮助页使用的名称,读者更熟悉的旧称是 NotebookLM。
它支持 PDF、网页、YouTube、音频、Google Docs 和 Slides 等来源。用户可以选择或排除具体材料,Chat 回答以所选来源为依据,并用行内引用跳回原始引文与上下文。这种设计很适合比较多份访谈中的共同主题,或从项目文档追查某个决定的依据。
范围受控仍会继承材料本身的问题。上传文件缺页、版本过旧,或只保留支持某项假设的文档,回答也会沿着同样的偏差前进。把来源清单、版本和纳入理由留在 notebook 之外,后续审阅会稳妥得多;实验性的 agentic 功能也应保持人工监督。
自 2026 年 9 月 2 日起,Gemini Notebook 改用基于计算量的限制,提示复杂度、所用功能和历史记录都会影响消耗。产品内用量表才是当前依据,旧文章列出的固定 notebook、source 或 chat 数量已经不能当作通用额度。
处理学术问题:问答案、做表格、读论文各有入口
Consensus:先看研究大致怎么说
Consensus 适合把自然语言科学问题转成论文检索。当前 Research Agent 会执行多步骤语义搜索、论文或 DOI 查找与引用图谱操作,并展示过程轨迹;Citation Grounding 可把摘要中的引用定位到原文具体引文和章节,条件允许时还会链接 PDF。
官方称其语料覆盖超过 4 亿条 scholarly sources,并通过出版社合作取得部分付费全文。这个数字只能描述厂商披露的范围,不能证明某个主题覆盖完整,也不能代替论文的方法质量评价。
Free 方案为 $0,提供不限量 paper searches,每月 10 条 Pro messages、3 次 Deep reviews、10 个 Study Snapshots 和 30 次 API/MCP calls。Pro 为 $20/月或 $144/年,Deep 为 $65/月或 $540/年。它适合在研究初期判断争议分布、找到代表论文,正式结论仍应回到全文。
Elicit:把筛选和抽取变成可重复的表格
需要比较数十篇论文的研究设计、样本、干预、结局或限制时,Elicit 的结构化工作流更有价值。它支持大规模筛选、自定义 extraction columns 与解释,把 inclusion criteria 和证据字段直接放进表格,比连续聊天更容易发现缺项和冲突。
Basic 免费方案包含有限的 Research Agent/Reports、论文搜索、摘要、paper chat、来源查看和 Zotero 导入。学术方案 Plus 在核验时为 $11/用户/月,按年付费;行业方案 Pro 为 $49/用户/月,按年付费。两个价格对应不同受众,不能合并成一个通用价。Reports 可导出 PDF 或 Word,tables 可导出 CSV 或 Excel,引用可导出 RIS 或 BIB;部分表格导出需要更高方案。
Elicit 官方说明产品以英语为主要优化对象,来源也以英语居多,其他语言的搜索和分析质量可能不一致,还可能消耗更多额度。多语言综述要补上对应语种数据库和人工筛选,不能把英文结果当成完整样本。
SciSpace:在同一工作区搜索、阅读和整理
SciSpace 把论文发现、针对单篇论文提问、自定义列提取、collection 与 library 放在一个工作区。适合不想频繁切换阅读器、问答和整理表格的读者,尤其是已经知道主题范围、希望边读边归档的人。
官方同一页面曾出现 2.87 亿和 2.8 亿以上两种语料数字,较稳妥的写法是“官方称覆盖 2.8 亿以上论文”。语料规模不等于检索无遗漏,官方自家比较或准确率榜单也不作为本文排序依据。
Basic 提供免费入口,每月 100 credits;Premium 每月 1,200 credits,价格为 $12/月,按年计费。credits 消耗随任务变化,无法固定换算成统一的提问次数。SciSpace 的广度方便,但证据标准仍要由研究者提前设定。
这三款工具可以按产物来选。想快速定位论文依据,先用 Consensus;要把筛选和抽取留下可复查表格,选 Elicit;希望把发现、阅读、提问与资料库放在一起,SciSpace 更贴近工作习惯。
找到关键论文后,再追它的后续命运
Scite:检查引用发生在什么语境
传统引用次数只告诉人们“有人引用过”。Scite 的 Smart Citations 进一步标出后续研究是在 supporting、contrasting 还是 mentioning 的语境中引用某项工作,适合寻找反例、争议和后续验证。官方页面称覆盖 3 亿以上 sources 与 16 亿以上 citation statements;这些仍是厂商的数据规模描述。
Connect 免费方案每月提供 25 个 MCP credits,但不包含完整 Assistant/Search。Basic 有 Assistant、Search、Smart Citation reports、collections 和 alerts;Pro 再增加 API、更高 MCP 额度,以及专利、临床试验和资助等数据。2026 年 9 月 30 日核验到的年付折算价格为 Basic $20/月、Pro $50/月。
Smart Citation 的分类提供核验入口,不负责裁决论文真假。看到 contrasting 标签后,仍要读引用句前后文,确认分歧来自样本、方法、统计选择,还是研究对象本就不同。
ResearchRabbit:沿引用网络扩展相邻研究
ResearchRabbit 从少量 seed papers、关键词或 collection 出发,沿引用关系与元数据持续扩展文献。可视化网络和时间关系适合找关键作者、研究分支、早期奠基论文与近期延伸成果。
免费方案提供不限量搜索、library/collections、协作,以及最多 50 篇 seed articles。RR+ 在核验时为按年付费折算 $10/月,或月付 $12.50,最多可用 300 个 seeds,并增加项目、控制项和 integrity signals。
它负责发现和画出关系,不会替研究者综合证据。种子论文质量会影响扩展方向,最终纳入哪些论文、排除理由是什么、检索何时停止,都需要另行记录。
Scite 与 ResearchRabbit 组合起来很实用:前者检查一项工作后来受到怎样的支持或质疑,后者把作者、分支和新论文铺开。得到的新论文再回到筛选表与原文核验,文献图才会变成证据链。
八款工具放在一张表里看
下表记录的是 2026 年 9 月 30 日快照。免费额度、促销与地区价格会变化;“有用的免费入口”表示足以了解基本工作方式,并不承诺能完成整项研究。
| 工具 | 最适合 | 来源边界与证据路径 | 有用的免费入口 | 付费快照 | 主要限制 |
|---|---|---|---|---|---|
| Perplexity | 开放网页快查、建立初始来源清单 | 网页答案附来源,需打开原文检查支持度 | 近乎不限量 basic search;当时每日 3 次 Pro Search、每月 1 次 Research | 官方页未提供稳定个人 Pro 标价 | 网页质量不一,引用多不代表陈述成立 |
| ChatGPT Deep Research | 多来源调查与结构化长报告 | 可综合网页、文件和其他上下文,报告附来源 | 依账户与工作区而异 | 本轮官方资料不足以确认统一价格和额度 | 范围越开放,核验成本越高 |
| Gemini Notebook | 只依据批准资料分析 | 在选定来源内回答,可回到具体引文与上下文 | 按计算量限制,产品内显示用量 | Plus/Pro/Ultra 提高限制,具体以账户为准 | 资料集不完整时,回答也会遗漏 |
| Consensus | 科学问题快查与原文定位 | 学术语料、过程轨迹和 Citation Grounding | 不限量 paper search,另有有限 Pro/Deep 额度 | Pro $20/月或 $144/年;Deep $65/月或 $540/年 | 快速综合不能替代全文和方法评价 |
| Elicit | 论文筛选、结构化证据提取 | 学术搜索、筛选、抽取列与多格式导出 | Basic 提供有限搜索、chat、reports 和来源查看 | 学术 Plus $11/用户/月年付;行业 Pro $49/用户/月年付 | 以英语优化,多语言研究需补充检索 |
| SciSpace | 集成式学术阅读工作区 | 论文发现、单篇问答、自定义列与资料库 | Basic 每月 100 credits | Premium $12/月年付,1,200 credits/月 | credits 随任务消耗,语料规模不代表完整 |
| Scite | 引用语境和争议核查 | Smart Citations 区分 supporting、contrasting、mentioning | Connect 每月 25 MCP credits | Basic $20/月年付;Pro $50/月年付 | 分类需要人工解释,不裁决结论真伪 |
| ResearchRabbit | 引用网络与相邻文献扩展 | 从 seeds、关键词或 collection 迭代发现 | 不限量搜索与 collections,最多 50 个 seeds | RR+ $10/月年付或 $12.50 月付 | 擅长发现,不负责证据综合 |
价格低不等于研究成本低。一个免费工具若无法导出筛选记录,后续人工搬运和补日志的时间可能更贵;付费工具若把引用精确落到原文段落,也只缩短了查找步骤,判断责任仍在人。
把带来源的回答变成可复核研究
工具选对后,研究质量仍取决于记录方式。下面这套流程适合网页调查、内部资料分析和一般文献研究;正式系统综述还要增加下一节的方法要求。
- 先写研究问题和边界。 记录时间范围、地域、允许的来源类型、排除项和交付格式。模糊的“研究某行业”很难查漏,具体问题才能判断何时停止。
- 把发现与下结论分开。 先用开放网页或学术搜索收集候选来源,不急着写最终判断。搜索阶段保留不同立场,避免答案过早收窄。
- 冻结一批材料。 保存数据库、平台、检索式、检索日期和筛选理由。指定资料任务还要记录文件版本,防止后来上传的修订稿改变结论却无人察觉。
- 为重要陈述留证据条目。 至少保存原文引文、页码或章节、发布日期、链接,以及这段材料具体支持哪句话。摘要只能做入口,不能代替全文证据。
- 主动寻找反例和后续研究。 Scite 可找 contrasting citations,ResearchRabbit 可沿网络扩展分支,学术搜索再补关键词与作者检索。反对材料需要进入同一张筛选表。
- 分开写材料内容与解释。 一列记录来源明确说了什么,另一列记录编辑或模型的综合判断。推论的跨度因此更容易被审阅者发现。
- 交付前逐条复核。 检查链接能否打开、引文是否对应附近陈述、日期和数字是否沿用原始口径。高影响结论交给熟悉主题的人复审。
随机抽查远远不够。优先核对会改变决策的数字、比较结论、因果说法和带有“普遍”“显著”“安全”等强判断的句子;每一项都要回到原始来源,再看全文上下文是否保留了限制条件。
系统综述有更高的方法门槛
AI 工具可以加快论文发现、字段提取、引用追踪和初步综合,却不能单独完成可复现的系统综述。PRISMA-S 指出,单一数据库无法给出完整且准确的相关研究清单;报告还应记录使用的数据库与平台、完整检索式以及网页检索方式,让别人能够复现。
这意味着正式综述仍要有预先定义的 protocol、多数据库检索、完整搜索日志、去重、纳入与排除标准、质量评价和人工筛选。Elicit 的抽取表、Scite 的引用语境或 ResearchRabbit 的文献网络都能成为其中一个环节,但任何一款产品的语料库、摘要或“共识”都不能覆盖整套方法。
先用一个真实问题试跑
今天只想先试一款,可以拿一个真实问题和几份已知来源做小规模试跑:开放网页快查选 Perplexity,复杂综合报告选 ChatGPT Deep Research,限定资料选 Gemini Notebook,结构化抽取选 Elicit,科学问题快查选 Consensus,引用语境选 Scite,文献扩展选 ResearchRabbit,集成式学术阅读选 SciSpace。记录它漏掉了什么、引错了什么、导出后还缺哪些字段,再决定是否付费。
好的研究工具会减少搜索、定位和搬运材料的时间。结论能否经得住复查,取决于来源边界是否清楚、证据是否落到原文,以及人的判断有没有留下记录。



