把评论导出来分析,绝大多数人的做法是选中页面、复制、粘进 Excel。
慢还是次要的。真正的问题是这样粘出来的表缺少判断所需的列——你会得到标题、正文和星级,但丢掉了这条评论是不是实际购买、属于哪个变体、有多少人点赞。而这三项恰恰决定了这条评论该不该计入结论。
21 列分成四组
第一组,口径(4 列)。 站点、ASIN、采集日期、评论日期。
采集日期和评论日期必须分开。评论日期决定这条反馈属于哪个批次,采集日期决定这张表什么时候过期。只记一个,两个月后这张表就无法判断还能不能用。
第二组,评论本身(4 列)。 星级、评论标题、内容摘要、变体 SKU。
变体 SKU 这一列是多数手工表格没有的。它对应接口的 skus 字段,标明这条评论挂在哪个变体上——父体页面会把所有变体的评论混在一起展示。
第三组,来源与影响力(8 列)。 实际购买、特邀评论、免费评论、抢先体验、含图、含视频、点赞数、评论人标签。
前四列对应 verified、vine、free、experience 四个布尔值,决定这条评论能不能进基准。后四列决定它的实际影响力:一条 47 赞的带图差评和一条 0 赞的纯文字差评不是一回事。这四个来源字段各自是什么意思,见亚马逊评论的四种来源。
第四组,你的判断(5 列)。 计入基准、问题归类、涉及环节、可行动、备注。
这一组接口不提供,必须人工填——也正因为如此,要和前面三组物理隔开。把观察和结论混在同一列里,是一个猜测被当成发现发出去的常见路径。
每列对应哪个接口字段
表格第三行就是字段映射行,直接写在文件里:
| 表格列 | 接口字段 |
|---|---|
| 评论日期 | date(时间戳) |
| 星级 | star |
| 评论标题 | title |
| 内容摘要 | content |
| 变体SKU | skus |
| 实际购买 | verified |
| 特邀评论 | vine |
| 免费评论 | free |
| 抢先体验 | experience |
| 含图 / 含视频 | image / video |
| 点赞数 | likes |
| 评论人标签 | authorLabels |
手工填的时候按这个顺序填,以后换成接口时列不用动。 这是这张表的设计目的:手工版和接口版是同一张表。
导出时的三个坑
一、数组字段不能直接塞进一个单元格。
skus、images、videos、authorLabels 返回的都是数组。直接写进单元格会得到一串带方括号的文本,排序和筛选都用不了。做法是:要么取第一个值,要么用分号连接,但整张表要统一,不能一半用逗号一半用分号——CSV 里的逗号会把列错开。
二、date 是时间戳,不是日期字符串。
返回的是毫秒级时间戳(示例值 1772380800000)。直接粘进表格会显示成一串数字,按日期排序会得到错误的顺序。导出时就转成 YYYY-MM-DD,不要留到分析时再处理。
三、布尔值要统一写法。
verified 等四个字段返回的是真假值。写进表格时统一成「是 / 否」或统一成 TRUE / FALSE,不要混着来。混写之后没法用一个筛选条件把「实际购买且非特邀」这一批选出来,而这正是算基准星级要做的第一步。
分页和星级筛选
接口按 ASIN 分页返回,另有一个 stars 参数接受星级数组。
做问题分析时不需要把全部评论拉下来——直接取 1 到 2 星就是一份问题清单。想看最具体的描述,取 3 星那一档。
分页要注意的是:评论是会增加的。 今天翻到第 5 页和下周翻到第 5 页,内容未必对得上。所以采集日期这一列不是装饰,它是这批数据的版本号。
查评论接口按 ASIN 分页获取评论,支持星级筛选,完整的请求参数和返回字段表在文档里什么时候手工表格就不够了
这张表填一个 ASIN 的 50 条评论,大约 30 到 40 分钟。
不够用的信号很明确:
- 要盯的不止一个 ASIN。 五个竞品各 50 条,一次就是大半天
- 要定期复查。 评论是持续增加的,上个月的表这个月已经不代表现状
- 要按变体分组统计。 手工按
skus分组,一次还行,每月一次就不行了
到这一步就该把它变成一个定时任务了。表里的数据怎么变成结论,见亚马逊评论分析怎么做。列不用改——字段映射行写的就是接口字段名。
常见问题
能一次导出全部评论吗? 接口按页返回,需要在你这边循环翻页。ASIN 多的时候这会影响调用量,先估一下。
为什么我导出的评论数比页面显示的少?
先确认 ASIN 层级。父体页面汇总所有变体,而你查的可能是单个子体。用 skus 列核对。
表格里要不要保留评论全文? 建议只留摘要。全文会让表格变得极难阅读,而判断通常靠前两句就够了。需要原文时按评论日期加星级回查。
能用模型自动归类问题吗?
可以,而且这是这张表最适合交给模型的一列。但要把模型的输出填在「问题归类」列,也就是判断组里——它和 content 这类事实列必须分开。