Apify 是什么?先判断它能不能解决你的采集任务
披露:本页含联盟推广链接。你通过本页链接注册 Apify 并付费,我们可能获得佣金——不影响你支付的价格,也不改变我们如实记录的实测数据。 我们如何实测 →
证据口径:本页于 2026-07-30 按 Apify Get started、Actors 官方文档 与 Input and output 核对平台概念。本站没有为这篇解释页触发新 run;带“实测”的样本、费用和 Run ID 只出现在已绑定一方证据的任务页。
Apify 不是“输入网址就永远自动出答案”的万能搜索框。它更像一套在云端运行采集与自动化任务的环境:从 Store 选择一个 Actor,给它输入条件,运行后查看输出;结构化表格通常在 Dataset,文件或其他非结构化内容通常在 Key-value store。需要持续更新时,再把相同输入保存并设成 Schedule。
真正要先回答的不是英文名词,而是:你要稳定拿到哪一类公开数据,拿到之后准备做什么? 本站不做泛平台翻译,而是把这个问题落到有真实输出样本和费用记录的任务里。
先用一句话判断:你适不适合用
适合先试:你已经能说清目标平台、输入条件和要的字段,例如“抓某城市某行业的商家电话和官网”“每天取一批 Amazon SKU 的价格和库存”“导出公开社媒帖子”。这类任务有可检查的输入和输出,小样本阶段就能判断是否有用。
暂时别直接开跑:你只想“找客户”但没有行业、地区或筛选标准;你需要的是私有数据;你准备把公开资料不经判断地群发或二次发布;或你需要秒级、零失败、带 SLA 的实时服务。先把需求和合规边界写清,别把 Actor 当成保证结果的黑箱。
五个名词,够你完成第一次运行
| 英文 | 在实际工作里是什么意思 |
|---|---|
| Actor | 为某个网站或任务准备的云端采集程序 |
| Input | 本次运行的条件:搜索词、城市、URL 列表、数量、国家/语言 |
| Run | 一次可复查的执行记录:状态、耗时、输出和实际扣费 |
| Dataset | 通常保存结构化表格结果:可导出 CSV / JSON,或交给表格、数据库和后续分析 |
| Key-value store | 通常保存文件或其他非结构化内容 |
不同 Actor 的字段、稳定性、计费方式、输入限制和结果位置都可能不同。因此不要按“用户数最多”或“名字最像”选择,也不要假设所有结果都在 Dataset;先读具体 Actor 的 README,再到本次 run 的 Output / Storage 核对。
结果看清以后,再决定下一步
只是查看一次结果,就先留在 Console 完成人工核对;需要复用相同输入,再保存成 Task;需要定时触发,再设置 Schedule;需要接入自己的程序,才进入 API。不要在字段和费用还没通过小样本时,同时搭自动化和接口。
| 你卡住的问题 | 对应中文指南 | 能拿走什么 |
|---|---|---|
| Store 里同一任务有很多 Actor | Actor 与 Store 怎么选 | 维护者、输入输出、价格与失败检查表 |
| Dataset、文件、队列分不清 | Storage 与导出 | CSV/JSON/API 导出路径与字段检查 |
| 一次运行怎样变成周期任务 | Tasks 与 Schedules | 保存输入、时区、频率和失败处理 |
| 程序怎样启动 run 并取结果 | Apify API v2 | Bearer token、Run 状态与 Dataset 闭环 |
| 要接自动化画布 | Apify × n8n | Run Actor → Get Dataset Items 数据流 |
| 结果要交付到表格 | Apify → Google Sheets | n8n、Make、Zapier 与 CSV/XLSX 四条现行路线 |
按你的任务选第一条路线
| 你现在要完成的工作 | 从哪一页开始 | 先验证什么 |
|---|---|---|
| 找本地商家、电话和官网 | Google 地图商家采集 | “行业 + 城市”能得到哪些字段、成本怎样算 |
| 做外贸/B2B 线索名单 | 获客线索采集 | 地图名单和公开领英主页怎样分工、触达前注意什么 |
| 跟踪竞品 SKU 的价格和库存 | 竞品价格监控 | 怎样把 SKU 列表变成每日快照,何时不该把它当实时监控 |
| 观察竞品的搜索呈现、广告与商品动作 | 竞品情报采集 | 三种公开信号怎样分开采集并留下可复查记录 |
| 准备 RAG 或 AI 工作流的数据 | AI / RAG 数据准备 | 怎样保留来源和更新时间,而不是把网页原样塞进模型 |
| 让 AI 客户端调用已有任务 | Apify MCP 中文指南 | MCP 是调用入口,费用和输出仍由具体 Actor 决定 |
第一次不要追求“全自动”,只做一个小闭环
- 选一个任务页,复制最小输入,先限制在能人工核对的小样本。
- 在 Output / Storage 检查对应结果;若是 Dataset,就逐列核对关键字段、空值、重复项和地区差异。
- 打开 Runs,对照状态、结果数和费用。三项都可接受,再保存任务或设置定时。
这能让你先验证数据是否完成工作,再决定是否扩大数量。只有关键字段可用、实际费用可接受、重复运行的差异能解释,才进入下一步;Run 显示 Succeeded 本身不等于数据合格。价格、免费额度和当前计费规则请看 Apify 收费详解 与 当前免费额度能抓多少;不要拿旧教程或别人的价格截图做预算。
三个常见误区
- Actor 不是官方背书。 Store 有不同维护者;评分、字段和计费会变化。本站只为跑过的具体任务写步骤。
- 公开可见不等于可以任意使用。 抓取、保存、分析和对外触达是不同环节。涉及个人信息、批量营销或商业发布时,先读 合法、安全、数据能商用吗。
- 自动化不是免维护。 输入条件、目标网页、Actor 价格和输出字段会变。持续任务应保留输入版本、运行记录和抽样检查。
上手前最后几个问题
Apify 和爬虫、API 是一回事吗?
不完全是。爬虫是获取网页公开信息的一类技术;API 是程序间交换数据的接口;Apify 是承载 Actor、运行、存储、定时和导出的平台。一个 Actor 可能抓网页,也可能调用公开接口。
第一次需要写代码吗?
不一定。本站任务页给出控制台的最小输入和导出路径,小样本验证不需要自己搭服务器。接数据库、Webhook 或 AI 工作流时,再进入 API、MCP 或自动化集成。
先比较 Actor,还是先注册?
先从你的目标任务进入一页已实测页面,确认字段和限制,再用最小样本运行。不要先按“最热门”选择。
已经知道要抓哪类公开数据?从一个小样本开始验证。
compass/crawler-google-places 按 $0.004/条计,$5 免费额度约合 1,250 条;不绑卡,跑完再决定要不要付费。
免费跑我自己的第一批 →