搜"亚马逊数据库"的人,多半想要一份能下载下来慢慢查的数据集。
这样的东西不存在,而且原因不是没人做。是两个结构性的事实决定的:数据按授权边界天然分成三块,谁都拿不全;而且它是流不是库——每个数字都只在一段时间内有效。
第一件事:数据按「谁的」分成三块
| 这一块 | 谁能拿到 | 典型内容 |
|---|---|---|
| 你自己店铺的 | 只有你(卖家账号授权) | 订单、库存、结算、广告花费、搜索词报告 |
| 平台公开的 | 所有人 | 商品、价格、排名、评论、类目、关键词 |
| 谁都拿不到的 | 没有人 | 竞品真实订单量、竞品后台搜索词、买家身份 |
第三行不是「暂时没有」,是设计上就不存在公开渠道。 如果一个方案依赖第三行,要改的是方案而不是找数据源。
第一行和第二行来自完全不同的授权模型,所以没有哪个接口能同时给你两者——这也是"一个数据库装下全部"不成立的直接原因。三条路各自能拿到什么,亚马逊数据 API 怎么选拆得更细。
第二件事:公开侧具体有什么
公开这一块不是一个大表,是按业务域分开的一组接口。当前 46 个,按域看密度差别很大:
| 域 | 接口数 | 回答什么 |
|---|---|---|
| 市场 / 类目 | 14 | 这个类目多大、谁在里面、结构怎么分布 |
| 流量 / 关键词流向 | 6 | 这个商品靠哪些词曝光、位置在哪 |
| ASIN 维度 | 5 | 单个商品的详情、趋势、竞品 |
| 品牌 | 4 | 商标与品牌层面的信息 |
| 商品筛选 | 3 | 按条件筛出候选商品 |
| ABA 搜索词 | 3 | 平台公布的搜索词排名与变化 |
| 销量预测 | 2 | 排名换算成销量量级 |
| 关键词挖掘与转化 | 4 | 词的竞争度、竞价、转化表现 |
| 评论 | 1 | 评论内容、星级与来源标记 |
市场域占了 14 个,是最密的一块。 这反映了一件事:公开数据最擅长回答的是"这个市场什么样",而不是"某个竞品具体怎么样"。
按业务场景怎么串这些接口,见亚马逊数据 API 完全指南。
第三件事:它是流不是库
这是"下载一份数据集"这个想法最根本的问题。同一个字段,时效差几个数量级:
| 字段 | 多久失效 | 意味着 |
|---|---|---|
| 价格、优惠券 | 小时级 | 昨天的价格已经不能用来定价 |
| BSR、排名 | 天级 | 隔夜的排名只能看方向 |
| 评论数、评分 | 天级累积 | 单点没意义,要看增速 |
| 销量估算 | 跟随排名 | 排名变了它就变了 |
| 类目结构、卖家构成 | 月级 | 这类适合按月存一份 |
| 商品标题、品牌、上架日期 | 基本不变 | 存一次就够 |
所以"存一份数据"这个动作,存的永远是快照,不是数据本身。 快照有没有用,取决于你有没有记下它是什么时候拍的——这也是我们所有模板都把采集日期单列一列的原因。
那能不能自己存一份
能,而且该存。但要按上面的时效分层:慢字段落库、快字段实时取、中间的定时刷新。
这个切分怎么做、以及调用量怎么估,见对接前要定的五个决策。判断标准很简单:一个字段如果在你用它之前就会失效,那存它只是在给自己制造过期数据。
三件任何数据源都给不了的
竞品的真实订单量。 平台不公开销量,所有月销数字都是从 BSR 推算的。字段名里的 est 就是接口自己标的,见销量数据能拿到什么、拿不到什么。
竞品的后台搜索词报告。 那是对方卖家账号的授权数据。反查给的是公开搜索结果里实际出现过的词,两者来源不同也不对应。
因果。 数据能告诉你排名掉了,不能告诉你为什么。原因要配你自己的改动记录。
常见问题
有没有现成的亚马逊数据集可以下载? 公开侧的数据可以通过接口取,但它是按查询返回的快照,不是一份静态数据集。真正需要"一份"的场景,通常是把接口结果按自己的口径落库。
所谓"亚马逊大数据"是什么? 一般指第二块——平台公开侧的聚合数据。它的价值在横向比较和趋势判断,不在单点精确。
数据能保留多久? 取决于字段。历史类接口通常支持按自然月回看,但具体范围以各接口文档为准,不要假设任意久远的月份都有数据。
同一个数据在不同来源对不上怎么办? 先对齐三件事:站点、类目层级、取数时间。公开字段(价格、BSR、评分数)应该一致,不一致是口径问题;销量类是推算,不一致是正常的。完整的判断方法见亚马逊数据分析怎么做。