一句话回答
0成本获取亚马逊数据是可行的——但它从来不等于”没成本”。本文把免费路径拆成「官方源 → 自助采集 → 自建管道」三层,给你能直接跑的代码与公式,再附一份把时间折算成钱的时间成本账本,让你清楚知道什么时候”免费”反而更贵。

网上几乎所有讲0成本获取亚马逊数据的文章都是同一个套路:列一圈 Keepa、Helium 10、Jungle Scout、Octoparse,然后教你点几下导出表格。这没错,但它把一件该被认真对待的事压扁成了”工具清单”,而且悄悄回避了最关键的一句:工具免费,不代表数据免费,更不代表你没在付钱——你付的是时间。这篇文章换个做法:先把亚马逊”免费数据”到底有哪些来源讲清楚,再指出主流方案的五处遗漏,然后手把手给你能落地的分层实操(含 Python 与 Google Sheets 公式),最后用一份时间成本账本告诉你临界点在哪——过了那个点,付费就比自建更划算。

如果你更关心”怎么把搜索结果数据取回来当情报用”,可以先看我们这篇 亚马逊关键词搜索结果抓取:从列表到信号画布;想补广告位这块的,再读 SP 广告位采集率为什么是分水岭

0成本获取亚马逊数据:先厘清”免费”到底有哪些来源

把”免费拿亚马逊数据”的路径摊开,其实只有四类来源。很多人把它们混为一谈,所以才会觉得”免费方案很乱”。分开看就清楚了——下面每一类都给你能照着点的具体操作和真实示例,而不是只列工具名。

A. 亚马逊官方免费源:0成本获取亚马逊数据的合规起点

官方源合规、稳定,是免费路径里最该先点亮的。以品牌卖家身份登录 Seller Central(sellercentral.amazon.com),按这条路径点:Brands → Brand Analytics → 左侧选 Search Query Performance;右上角时间范围选「最近 30 天」,搜索框输入核心词(例:yoga mat),点 Export CSV。导出的表里 5 列必留:search query(搜索词)、clicked ASINs(被点击商品)、click share(点击份额)、cart-add share(加购份额)、purchase share(购买份额)。看一个真实读数:在 yoga mat 下,你的 ASIN B0ABCD1234 拿到 click share 12.3%、cart-add 8.1%、purchase 6.4%——这比任何选品工具的估算都权威,因为是亚马逊自己统计的漏斗。

没有卖家后台但有开发者资质,走 SP-API:打开 developer.amazonservices.com → 创建 app → 勾选 Catalog ItemsReports 两个 role → 用 Login with Amazon 拿 refresh token;有了 token,后面「实操 3」会给你一段能直接跑的拉 listing 代码。做联盟内容站则走 PA-API(Associates Central 申请),用 GetItems 传一个 ASIN,返回 title、price、rating 三个字段,足够做商品卡。普通用户没权限也别急:打开 Best Sellers(例 https://www.amazon.com/Best-Sellers/zgbs/electronics),手动记前 20 个 ASIN、价格、评分、评论数、排名——这就是你后续自动化的字段模板。

0成本获取亚马逊数据的官方免费源操作路径:Brand Analytics、SP-API、PA-API与公开页面
图2:官方免费源操作路径——先确认权限,再下载报告或测试 API,最后用公开页面补字段模板。

B. 免费第三方工具:把”工具”当假设验证器用

免费工具好用,但给的是加工过的结论,不是原始数据。正确用法是「验证假设 + 记置信度」,具体四步:

  • 1) Keepa 看价格底线。装浏览器插件,打开任意商品页(例 https://www.amazon.com/dp/B0EXAMPLE1),切到 Price history 标签,看 90 天价格曲线。举个真实读数:某 ASIN 90 天最低 $19.99、Buy Box 占比 87%、出现过 3 天断货——这告诉你它的价格底线和供货稳定性。
  • 2) CamelCamelCamel 设价格提醒。把 3–5 个竞品 ASIN 粘进去,设 price alert,例「低于 $25 提醒我」,触底时它会发邮件。
  • 3) Helium 10 / Jungle Scout 看估算需求。搜索 wireless earbuds 结果页,点 X-ray,看 Top 10 估算月销。例 B0EARBUD01 估算月销 4,200 件——只记相对排序,别把这个数当真实 GMV。
  • 4) 汇总成一张验证表。建 Google Sheet,列:ASIN | 工具来源 | 价格区间 | 评论壁垒 | 估算需求 | 置信度。示例行:B0EXAMPLE1 | Keepa | $19.99–$29.99 | 1,200 评 | 中 | 高。置信度低的项目,后面用 API 复核。
免费获取亚马逊数据的第三方工具操作流程:Keepa、CamelCamelCamel、Helium 10与Jungle Scout
图3:免费第三方工具的正确用法——用来验证假设、记录置信度,不把估算摘要当成原始数据。

C. 自助采集 DIY:从零代码到浏览器自动化

按「先无代码、再脚本、最后浏览器自动化」走,每一步都给一个可验证的小目标,这样你随时知道卡在哪:

  • 1) 无代码先验证字段在哪。Google Sheets 的 A1 放商品 URL,B1 输入 =IMPORTXML(A1,"//span[@id='productTitle']") 回车。返回标题,说明字段在静态 HTML 里;返回 #N/A,说明被 JS 动态加载——这就是你后面要上 Playwright 的信号。
  • 2) 脚本抓静态页。用「实操 1」的 Python,先只跑 1 个关键词、1 页、20 条,把原始 HTML 存盘再解析,导成 amazon_sample.csv,列:keyword | rank | asin | title | price。
  • 3) 动态页补广告位。搜索结果大量靠 JS 渲染,用「实操 4」的 Playwright 抓 wireless earbuds 首屏,数一数 Sponsored 标记。一次实跑通常能标到 3 个左右广告位——但首屏之外的滚动广告会漏,这正是免费 DIY 的完整性缺口。
  • 4) 每次运行记日志。写进 CSV:run_time | keyword | page | asin | missing_field_rate。缺字段率超过 20% 就要警惕,说明 DOM 又漂移了。
Python和Google Sheets自助采集亚马逊数据的落地流程
图4:DIY 自助采集流程——从 Google Sheets 小样本,到 Python 静态页,再到 Playwright 动态页面。

D. 公开数据集:当训练场,别当实时市场

公开数据集适合练方法与训模型,拿来当今天的市场会误判。具体四步:

  • 1) 选对数据集。Kaggle 搜 Amazon reviews 2023 或 Amazon products metadata,优先选带「Last updated」日期、字段说明文档、样本量标注的数据集。
  • 2) 下载后三连查。用 pandas:df.shape 看规模、df['year'].value_counts() 看年份分布、df['asin'].isna().sum() 看 ASIN 缺失。例:一份 2023 数据集 year 集中在 2023、asin 缺失 12 行——年份够新,但要先清洗。
  • 3) 清洗。删空 ASIN、按 review_id 去重、给缺失评分填中位数。
  • 4) 建模 + 小样本复核。用它训练评论情感模型或关键词聚类,再用当前公开页或 SP-API 抽 50 条小样本验证方法是否成立。例:用公开的 yoga mat 评论训情感分类,再抽 50 条今天的评论验证准确率。
使用Kaggle和GitHub公开数据集学习亚马逊数据分析的流程
图5:公开数据集适合做训练场——先核验年份、市场和 ASIN 字段,再用于离线模型与方法验证。

这四类里,A 和 C 是真正”可落地做情报”的来源;B 适合快速验证;D 只适合学习。下文的实操就围绕 A 与 C 展开。

0成本获取亚马逊数据的分层框架:官方源、自助采集、自建管道与时间成本账本
图6:0成本获取亚马逊数据的分层框架——从即时可用的官方源,到自助采集,再到自建管道,每一层”免费”的隐形成本都在上升。

0成本获取亚马逊数据的五处遗漏

主流文章的通病,是只告诉你”用什么工具”,不告诉你”会踩什么坑”。把市面方案的遗漏摊开,至少有五处:

遗漏一:把”工具免费”等同于”数据免费”

Keepa 免费版给你的是价格历史曲线,不是逐笔原始记录;Helium 10 X-ray 每日 10 个 ASIN,给你的是估算销量,不是真实订单。免费工具交付的是加工过的结论,而且往往带延迟与限额。你以为拿到了数据,其实拿到的是被压扁的摘要。真正做选品或竞品情报,你需要的是实时、原始、可回放的字段,而这恰恰是免费层不给的。

遗漏二:时间成本被无视——这才是”免费”的真账单

自建爬虫最贵的地方不是服务器,而是你的工时。一个能稳定跑的亚马逊采集管道,要持续对抗:反爬升级、验证码、IP 封禁、DOM 漂移、分页与 AJAX、多市场解析差异。保守估计,自建并维护一套覆盖 1–2 个市场的爬虫,每月要吃掉一个工程师 8–20 小时。按一个有经验爬虫工程师时薪 ¥150–¥300 算,”免费”其实每月花了你 ¥1,200–¥6,000——只是账没记在你头上。

遗漏三:合规与稳定性盲区

亚马逊的 robots 与服务条款对自动化采集有明确限制;高频请求会触发验证码、IP 限流甚至封号。很多”免费教程”教你直接 requests.get(),却不说一旦被识别,你拿到的就是残缺或被投毒的数据。没有代理轮换、没有重试与校验、没有异常告警的采集,是一台随时会停的机器——而且它停下来时不告诉你。

遗漏四:数据完整性缺口——免费采集漏掉最贵的广告位

这是最隐蔽的一处。免费爬虫大多只抓”看得见的商品列表”,却漏掉穿插其中的 Sponsored 广告位、Amazon’s Choice 徽章、Editorial Recommendations、Customers also bought 等模块。漏掉广告位,意味着你画的竞品地图从根上就是残缺的——你看不到的广告位,在你脑子里就不存在。我们专门论证过,Pangolinfo 是当前所有方案中 SP 广告位采集率最高的,没有之一:在 13 个市场上持续监控,整体每日广告覆盖率 91.4%,并通过飞书机器人把覆盖率报告推送给运维,异常当天修复。免费 DIY 能抓到一部分,但覆盖率的差距,直接决定了你情报的真实性。

遗漏五:规模化天花板

免费工具都有量上限(每日 ASIN 数、行数、并发);自建爬虫一旦要扩到多市场、高频次、长周期,工程复杂度会指数上升,而且没有 SLA 兜底。需求量小的时候免费够用;一旦你要批量、稳定、持续地拿数据,免费方案会从”省钱”变成”拖累”。

更先进的框架:分层实操 + 时间成本账本

把这五处遗漏翻过来,就是一套能落地的”0成本”框架。分四层,从易到难,每一层都附可跑的代码:

  • L0 · 即时可用。官方源 + 免费工具:开 Brand Analytics、装 Keepa 免费版、申请 SP-API。零代码,当天能用。
  • L1 · 自助采集。Python + requests/BeautifulSoup 抓公开页(Best Sellers、搜索结果),配限速与 UA 伪装。适合一次性或低频任务。
  • L2 · 自建管道。定时任务 + 代理轮换 + 本地存储(SQLite/CSV)+ 异常告警。适合需要持续监控、但量还没到批量的团队。
  • L3 · 时间成本账本。算清你每月在 L1/L2 上花的工时,得出”什么时候该转向付费”的临界点。

手把手实操:四段能直接跑的代码

实操 1:用 Python 抓 Best Sellers 公开页(L1)

这是最入门的免费采集。注意三点:设真实 User-Agent、限速(别高频)、不登录。仅抓公开页、仅用于研究。

import requests, time, random
from bs4 import BeautifulSoup

HEADERS = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) "
                  "AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/124.0 Safari/537.36",
    "Accept-Language": "en-US,en;q=0.9",
}

def fetch_bestsellers(url):
    resp = requests.get(url, headers=HEADERS, timeout=20)
    resp.raise_for_status()
    soup = BeautifulSoup(resp.text, "html.parser")
    items = []
    for card in soup.select("div.zg-grid-general-faceout"):
        title = card.select_one("._cDEzb_p13n-sc-css-line-clamp-4_2q2cc")
        price = card.select_one("span.p13n-sc-price")
        items.append({
            "title": title.get_text(strip=True) if title else None,
            "price": price.get_text(strip=True) if price else None,
        })
    return items

if __name__ == "__main__":
    url = "https://www.amazon.com/BestSellers/zgbs/electronics"
    data = fetch_bestsellers(url)
    for d in data[:10]:
        print(d)
    time.sleep(random.uniform(3, 6))  # 限速:抓完歇一下
提醒:亚马逊的 CSS 类名会随改版漂移(_cDEzb_p13n-sc-... 这类哈希类几乎每几周变一次)。上面的选择器今天能跑,下个月可能要换——这正是”时间成本”的来源之一。务必加异常处理与字段校验,别让管道静默返回空数据。

实操 2:用 Google Sheets 公式抓价格(L0,零代码)

不想写代码?用 Google Sheets 的 IMPORTXML 直接抓商品页的标题或价格。把商品 URL 放在 A1,在 B1 输入:

=IMPORTXML(A1, "//span[@id='productTitle']")

抓价格(注意亚马逊价格节点的 XPath 会变,需按页调整):

=IMPORTXML(A1, "//span[contains(@class,'a-price')]//span[@class='a-offscreen']")
局限:IMPORTXML 抓的是静态 HTML,亚马逊很多内容靠 JS 动态加载,公式常常抓不到;而且高频刷新会触发限流。适合一次性查几条,不适合批量监控。

实操 3:用 SP-API 合规拉 listing(L0,官方免费)

如果你是卖家或开发者,SP-API 是最稳的免费来源。前提:注册为 Amazon Selling Partner,创建 SP-API 应用,拿到 LWAA_TOKEN 与 refresh token。下面用官方 python-amazon-sp-api 拉一个 ASIN 的 listing:

# pip install python-amazon-sp-api
from sp_api.api import Catalog
from sp_api.base import SellingApiException

try:
    catalog = Catalog()
    item = catalog.get_item(asin="B08N5WRWNW")  # 示例 ASIN
    print(item.payload.get("ItemInfo", {}).get("Title", {}).get("DisplayValue"))
    print(item.payload.get("AttributeSets", {}))
except SellingApiException as e:
    print("SP-API error:", e)

SP-API 免费,但有速率配额(每接口每秒请求数有限),超量会被限流。它合规、稳定、字段全,缺点是只覆盖你自己有权限的 marketplace,且申请流程对非卖家不友好。

实操 4:用 Playwright 抓动态搜索结果(L2)

搜索结果页大量内容靠 JS 渲染,requests 抓不全。用 Playwright 驱动无头浏览器,并区分自然位与 SP 广告位:

# pip install playwright && playwright install chromium
from playwright.sync_api import sync_playwright
from bs4 import BeautifulSoup

def scrape_search(keyword):
    with sync_playwright() as p:
        browser = p.chromium.launch(headless=True)
        page = browser.new_page(
            user_agent="Mozilla/5.0 ... Chrome/124.0 Safari/537.36")
        page.goto(f"https://www.amazon.com/s?k={keyword}",
                  wait_until="domcontentloaded")
        page.wait_for_timeout(2000)
        soup = BeautifulSoup(page.content(), "html.parser")
        results = []
        for slot in soup.select("div[data-component-type='s-search-result']"):
            asin = slot.get("data-asin")
            slot_text = slot.get_text(" ", strip=True)
            is_sponsored = "Sponsored" in slot_text or "赞助" in slot_text
            results.append({"asin": asin, "sponsored": is_sponsored})
        browser.close()
        return results

print(scrape_search("wireless earbuds"))
关键:上面用页面文本粗略标注广告位——但 Playwright 默认只抓首屏,滚动加载的广告位会漏。这正是免费 DIY 的完整性缺口:你以为抓全了,其实只抓到了首屏可见的那部分。要补全,得做滚动 + 多次快照 + 覆盖率自检——复杂度立刻上一个台阶。

时间成本账本:什么时候”免费”反而更贵

把上面的隐形成本折算成钱,临界点就清楚了。假设一个有经验的数据工程师时薪 ¥200,下表是不同方案的”真实月成本”对比:

方案直接付费每月维护工时时间成本(¥200/时)真实月成本适合
免费工具(Keepa/H10 免费层)¥02–4h(手动查)¥400–800¥400–800低频、少量验证
自建爬虫(1–2 市场)¥0 + 代理¥2008–20h¥1,600–4,000¥1,800–4,200中频监控、有工程力
自建多市场管道¥0 + 代理¥80020–40h¥4,000–8,000¥4,800–8,800高频批量(此时已不划算)
接入 Pangolinfo API按量付费≈0(配调用)¥0–2h¥0–400 + 用量费批量、稳定、覆盖广告位

结论很直白:当你的数据需求从”偶尔查几条”升级到”批量、持续、要覆盖广告位”时,自建的工时成本会迅速超过付费 API 的用量费。免费不是错的,错的是把”免费”当成永远的最优解。

何时该转向付费:一个克制的建议

如果你的需求停在 L0/L1——偶尔选品、学习练手、验证假设——上面的免费路径完全够用,不必花钱。但一旦你的需求进入”批量化、稳定、持续、要看见广告位”的阶段,时间成本就会越过临界点,最经济的方式就是接入 Pangolinfo 的服务,把反爬、多市场 DOM 适配与覆盖率监控交给专门做这件事的一方:

这不是否定免费——而是承认一个常识:在商业项目里,时间也是成本。当你算完上面的账本,发现自建每月花掉四五千工时成本、还漏广告位时,付费就不再是”花钱”,而是”省钱”。

真的能0成本获取亚马逊数据吗?

能,但要分清”0直接付费”和”0成本”。官方源(Brand Analytics、SP-API、公开页)和免费工具(Keepa 免费版等)确实不花钱;但自建采集会吃掉你的工时——维护爬虫、对抗反爬、修复 DOM 漂移都是时间成本。需求量小的时候免费够用,量大时时间成本会超过付费 API。

自建爬虫抓亚马逊,最大的坑是什么?

不是写代码,是持续维护。亚马逊的 CSS 类名频繁漂移、反爬不断升级、IP 容易被封、动态内容靠 JS 加载。一个能跑的脚本和一套能稳定跑的管道之间,隔着一个工程师每月 8–20 小时的维护量——这才是”免费”的真账单。

免费采集为什么会漏掉广告位?

免费爬虫大多只抓首屏可见的商品列表,而 Sponsored 广告位是穿插在结果里、靠 JS 动态渲染的。不专门做滚动加载 + 类型标注 + 覆盖率自检,就会漏。Pangolinfo 在这块是当前所有方案中 SP 广告位采集率最高的,没有之一——13 市场整体每日覆盖率 91.4%,飞书机器人当天修复异常。

SP-API 免费吗?普通人能用吗?

SP-API 本身免费,但有速率配额,且需要你注册为 Amazon Selling Partner 并创建应用——对非卖家的普通用户不太友好。它是卖家/开发者最合规、最稳的免费来源,但不是”人人即开即用”。

什么时候该从免费切换到付费 API?

当你需要批量、稳定、持续地取数据,且要覆盖广告位时。一个简单判断:如果你每月花在维护自建爬虫上的时间超过 8 小时,或你的采集结果开始频繁漏数据、漏广告位,就说明时间成本已越过临界点——这时候接入 Pangolinfo 的 API/MCP/Skill 通常比继续自建更便宜。

总结

0成本获取亚马逊数据是可行的:用官方源(Brand Analytics、SP-API)打底,用免费工具快速验证,用 Python/Playwright 自助采集做定制。但别被”免费”骗了——工具免费不代表数据免费,更不代表你没在付时间。把时间折算成钱,你会看到一个清晰的临界点:需求量小,免费最优;需求量大、要稳定、要覆盖广告位,付费 API 就是最经济的那条路。把反爬与覆盖率交给 Pangolinfo,你省下的不是钱,是你最贵的时间。

作者 Leo,Pangolinfo 技术总负责人。Pangolinfo 每日在 13 个亚马逊市场监控 SP 广告位(整体覆盖率 91.4%),并通过飞书机器人把覆盖率报告推送给运维,异常当天修复。

微信扫一扫
与我们联系

QR Code
快速测试

联系我们,您的问题,我们随时倾听

无论您在使用 Pangolin 产品的过程中遇到任何问题,或有任何需求与建议,我们都在这里为您提供支持。请填写以下信息,我们的团队将尽快与您联系,确保您获得最佳的产品体验。

Talk to our team

If you encounter any issues while using Pangolin products, please fill out the following information, and our team will contact you as soon as possible to ensure you have the best product experience.