主题
Google 数据集信息 API 概览
Google 数据集信息 API 用于获取指定 Google Dataset 数据集的。标准模式通过 POST /v3/serp/google/dataset_info/task_post/ 创建任务,并通过 GET /v3/serp/google/dataset_info/task_get/advanced/ 获取结果;如需实时返回结果,可使用 /v3/serp/google/dataset_info/live/advanced/。
本接口基于 Google Dataset 搜索结果页中展示的数据集进行采集,可返回数据集、、许可证、描述等扩展信息。返回结果对应请求中指定的 dataset_id 参数。
建议使用响应中的 check_url 在浏览器无痕模式下打开,以核验返回的数据是否与目标数据集一致。
> 注意:Google Dataset Info API 支持 desktop 设备类型。创建任务时可指定 Windows 或 macOS 操作系统。
排名字段说明
SERP 返回结果中的排名字段:
| 字段 | 说明 |
|---|---|
rank_group | 结果在所属 SERP素组中的位置。 |
rank_absolute | 结果在整个 SERP部中的绝对位置。 |
例如,某数据集信息卡片可能是某个结果组中的第 1 条,但由于前方存在广告、自然搜索结果或 SERP素 rank_absolute 可能大于 1。
可用功能
Google Dataset Info Advanced
/v3/serp/google/dataset_info/live/advanced/ 可实时返回指定 Google 数据集的详细信息:
- 数据集与数据; -或发布组织信息;
- 数据集许可证;
- 数据集描述;
- SERP 中展示的扩展字段。
数据获取方式
本接口支持实时(Live)和标准(Standard)两种获取方式。
实时模式(Live)
实时模式适用于需要立即获取数据集的场景。请求会同步执行并直接返回结果,无需创建任务后再单独查询。
接口路径:
text
/v3/serp/google/dataset_info/live/advanced/实时模式通常更高的处理优级和相应费用。
标准模式(Standard)
标准模式适用于无需即时返回结果的批量采集场景,成本通常低于实时模式。使用该模式时,需要创建任务,再获取已完成任务的结果。
执行流程如下:
- 通过
POST /v3/serp/google/dataset_info/task_post/创建采集任务; - 等平台完成数据采集;
- 通过
GET /v3/serp/google/dataset_info/task_get/advanced/获取指定任务结果。
如需批量处理多个任务,可按以下方式操作:
- 通过
/v3/serp/google/dataset_info/tasks_ready/获取已完成任务的id列表; - 使用
/v3/serp/google/dataset_info/task_get/advanced/逐个获取任务结果。
创建任务时还可以下回调字段:
| 字段 | 说明 |
|---|---|
pingback_url | 任务完成后向指定地址发送完成通知。 |
postback_url | 任务完成后将结果直接推送至指定地址。使用该字段时,结果获取功能适用 advanced。 |
调用限制
| 限制项 | 说明 |
|---|---|
| API 调用频率平台限流以认证说明中的 30/60/120 次/分钟规则为准。 | |
| 单次 POST 任务数 | 每个 POST 请求最多 100 个任务。 |
如有更高并发或任务数量需求,请联系技术支持评估额。
优级与计费
标准模式支持两种任务优级:
normal:普通优级,适用于常规异步采集;high:高优级,适用于需要更快完成的异步任务。
实时模式会同步返回结果,通常最高处理优级。
不同获取方式、任务优级及附加参数会影响费用。扣费以响应头 X-SeerMarTech-Charge-CNY 为准。
测试环境
可通过 /v3/appendix/sandbox/ 测试接口请求与响应结构,便于在正式调用前完成集成验证。
实用场景
- 核验数据集许可证:提取目标数据集的授权与许可证信息,帮助团队判断数据能否用于研究、商业分析或模型训练。
- 监测竞品数据资产:跟踪竞品、研究机构或行业组织发布的数据集,识别重点研究方向与数据布局。
- 构建数据集资源库:批量采集特定主题下的数据集描述、和字段,为数据资产检索平台补结构化索引。
- 评估数据集可信度:结合、发布组织、描述和许可证等信息,对候选数据集进行来源审查与质量初筛。
- 发现行业研究机会:分析指定领域的数据集与发布,挖掘尚未覆盖的数据主题、和研究方向。