主题
获取 Google Dataset Info Advanced 结果
接口说明
GET /v3/serp/google/dataset_info/task_get/advanced/$id
根据任务 ID 获取 Google Dataset Info Advanced 任务结果。任务提交后,可在 30 天重复获取结果;获取结果本身不额外收费,扣费以响应头 X-SeerMarTech-Charge-CNY 为准。
请求参数
请求方式为 GET,无需请求体。
| 参数 | 类型 | 说明 |
|---|---|---|
id | string | 任务唯一标识,UUID 格式。任务提交后可在 30 天使用该 ID 获取结果。 |
响应说明
接口返回 JSON 数据 tasks 数组。
顶层字段
| 字段 | 类型 | 说明 |
|---|---|---|
version | string | 当前 API 版本。 |
status_code | integer | 通用响应状态码。 |
status_message | string | 通用状态说明。 |
time | string | 请求执行耗时,单位为秒。 |
cost | float | 平台原始 USD 成本兼容字段;人民币实扣以 X-SeerMarTech-Charge-CNY 为准。 |
tasks_count | integer | tasks 数组中的任务数量。 |
tasks_error | integer | tasks 数组中返回错误的任务数量。 |
tasks | array | 任务结果数组。 |
tasks 数组字段
| 字段 | 类型 | 说明 |
|---|---|---|
id | string | 任务唯一标识,UUID 格式。 |
status_code | integer | 任务状态码,通常为 10000 至 60000。 |
status_message | string | 任务状态说明。 |
time | string | 任务执行耗时,单位为秒。 |
cost | float | 平台原始 USD 成本兼容字段;人民币实扣以 X-SeerMarTech-Charge-CNY 为准。 |
result_count | integer | result 数组中的数量。 |
path | array | 请求 URL 路径。 |
data | object | 创建任务时提交的参数。 |
result | array | 任务结果数组。 |
result 数组字段
| 字段 | 类型 | 说明 |
|---|---|---|
keyword | string | POST 请求中提交的。返回时会解码 %##;加号(+)会被解码为空格。 |
se_domain | string | POST 请求中提交的搜索引擎域名。 |
language_code | string | POST 请求中提交的语言代码。 |
check_url | string | 搜索引擎结果页的直接 URL,可用于核验结果准确性。 |
datetime | string | 获取结果的日期和时间,使用 UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。 |
spell | object | 搜索引擎自动纠错信息。当搜索引擎对进行纠正时,返回纠正后的及纠错类型。 |
refinement_chips | object | 搜索结果细化选项。 |
item_types | array | SERP 中出现的结果类型。该接口可能返回 dataset。 |
se_results_count | integer | SERP 中的结果总数。 |
items_count | integer | items 数组中的结果数量。 |
items | array | SERP 中的 Dataset 结果。 |
items 数组字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 dataset。 |
rank_group | integer | 分组排名。在类型相同的组排名;不同类型的位置不会计此字段。 |
rank_absolute | integer | SERP 中的绝对排名,即所有结果中的位置。 |
position | string | 素在 SERP 中的对齐位置,可为 left 或 right。 |
xpath | string | 结果的 XPath。 |
dataset_id | string | 数据集 ID。 |
title | string | SERP 中显示的数据集标题。 |
image_url | string | 图片 URL。通常指向原始资源中的图片;如果原始来源不可用,则可能指向本平台存储的图片。 |
scholarly_citations_count | integer | 引用该数据集的文章数量。 |
links | array | 站点链接,即部分 Google Dataset 结果下方显示的链接;没有链接时为 null。 |
dataset_providers | array | 提供该数据集的机构列表。 |
formats | array | 数据集文件格式列表。 |
authors | array | 数据集列表。 |
licenses | array | 数据集许可证列表。 |
updated_date | string | 结果最近更新时间,使用 UTC 格式。 |
area_covered | array | 数据集覆盖区域,例如 Africa、Global。 |
period_covered | object | 数据集覆盖的时间范围。 |
dataset_description | object | 数据集描述信息。 |
links 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 link_element。 |
title | string | 链接标题。 |
description | string | SERP 结果描述。 |
url | string | 站点链接 URL。 |
domain | string | SERP 中显示的域名。 |
dataset_providers 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 dataset_providers_element。 |
title | string | 数据集提供方名称。 |
url | string | 数据集提供方网站 URL。 |
domain | string | 数据集提供方网站域名。 |
formats 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 formats_element。 |
format | string | 文件格式,例如 zip、html、csv。 |
size | string | 文件大小,单位为字节。 |
authors 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 authors_element。 |
name | string | 数据集名称。 |
url | string | 链接 URL。 |
domain | string | 链接域名。 |
licenses 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 licenses_element。 |
title | string | 许可证名称。 |
url | string | 许可证 URL。 |
domain | string | 许可证 URL 指向的域名。 |
period_covered 字段
| 字段 | 类型 | 说明 |
|---|---|---|
start_date | string | 覆盖周期开始时间,UTC 格式。 |
end_date | string | 覆盖周期结束时间,UTC 格式。 |
displayed_date | string | SERP 中展示的时间范围,例如 Mar 2, 2020 - Dec 9, 2022。 |
dataset_description 字段
| 字段 | 类型 | 说明 |
|---|---|---|
text | string | 数据集描述文本。 |
links | array | 描述文本中的链接列表。 |
dataset_description.links 中的字段如下:
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 link_element。 |
title | string | 链接锚文本。 |
description | string | SERP 结果描述。 |
url | string | 链接 URL。 |
domain | string | SERP 中显示的域名。 |
请求示例
cURL
bash
id="02261816-2027-0066-0000-c27d02864073"
curl --location --request GET \
"https://api.seermartech.cn/v3/serp/google/dataset_info/task_get/advanced/${id}" \
--header "Authorization: Bearer smt_live_YOUR_KEY" \
--header "Content-Type: application/json"PHP
php
<?php
$apiUrl = 'https://api.seermartech.cn/';
$taskId = '02261816-2027-0066-0000-c27d02864073';
$ch = curl_init(
$apiUrl . 'v3/serp/google/dataset_info/task_get/advanced/' . $taskId
);
curl_setopt_array($ch, [
CURLOPT_RETURNTRANSFER => true,
CURLOPT_HTTPHEADER => [
'Authorization: Bearer smt_live_YOUR_KEY',
'Content-Type: application/json',
],
]);
$response = curl_exec($ch);
if ($response === false) {
throw new RuntimeException(curl_error($ch));
}
curl_close($ch);
$result = json_decode($response, true);
print_r($result);TypeScript
typescript
import axios from "axios";
const taskId = "02231256-2604-0066-2000-57133b8fc54e";
axios
.get(
`https://api.seermartech.cn/v3/serp/google/dataset_info/task_get/advanced/${taskId}`,
{
headers: {
Authorization: "Bearer smt_live_YOUR_KEY",
"Content-Type": "application/json",
},
}
)
.then((response) => {
// 处理接口返回的数据
console.log(response.data);
})
.catch((error) => {
console.error(error.response?.data ?? error.message);
});Python
python
import requests
task_id = "02231256-2604-0066-0000-c27d02864073"
url = (
"https://api.seermartech.cn/v3/serp/google/"
f"dataset_info/task_get/advanced/{task_id}"
)
response = requests.get(
url,
headers={
"Authorization": "Bearer smt_live_YOUR_KEY",
"Content-Type": "application/json",
},
)
if response.ok:
result = response.json()
print(result)
else:
print(f"请求失败:HTTP {response.status_code},{response.text}")响应示例
json
{
"version": "0.1.20221214",
"status_code": 20000,
"status_message": "Ok.",
"time": "0.0729 sec.",
"cost": 0,
"tasks_count": 1,
"tasks_error": 0,
"tasks": [
{
"id": "02261816-2027-0066-0000-c27d02864073",
"status_code": 20000,
"status_message": "Ok.",
"time": "0.0729 sec.",
"cost": 0,
"result_count": 1,
"path": [
"v3",
"serp",
"google",
"dataset_info",
"task_get",
"advanced"
],
"data": {
"api": "serp",
"function": "task_get",
"se": "google",
"se_type": "dataset_info",
"dataset_id": "L2cvMTFqbl85ZHN6MQ==",
"device": "desktop",
"os": "windows"
},
"result": [
{
"se_results_count": 1,
"items_count": 1,
"items": [
{
"type": "dataset",
"rank_group": 1,
"rank_absolute": 1,
"position": "left",
"xpath": "/html/body/div[1]",
"dataset_id": "L2cvMTFqbl85ZHN6MQ==",
"title": "Water quality in Canadian rivers",
"image_url": null,
"scholarly_citations_count": 12,
"links": null,
"dataset_providers": [],
"formats": [],
"authors": null,
"licenses": [],
"updated_date": "2019-06-24 03:00:00 +00:00",
"area_covered": null,
"period_covered": {
"start_date": "2002-01-01 02:00:00 +00:00",
"end_date": "2017-12-31 02:00:00 +00:00",
"displayed_date": "Jan 1, 2002 - Dec 31, 2017"
},
"dataset_description": {
"text": "The Canadian Environmental Sustainability Indicators program provides data and information to track Canada's performance on key environmental sustainability issues.",
"links": []
}
}
]
}
]
}
]
}状态码与错误处理
请根据顶层 status_code 和任务级 tasks[].status_code 判断请求是否成功:
20000:请求或任务处理成功。40000及以上:任务处理失败或返回错误,应结合status_message排查。- 当
result为null或不存在时,不应继续按成功结果处理。 - 建议在业务系统中针对网络异常、任务失败、结果为空和响应时建立重试及异常处理机制。
实用场景
- 监测数据集 SERP 展现:批量获取 Google Dataset 结果及排名信息,评估数据集在目标下的可见度。
- 分析数据集信息:提取数据集标题、描述、、许可证和更新时间,支持数据资源质量评估。
- 追踪数据集来源机构:识别数据集提供方及官网域名,构建行业数据供应商与权威来源单。
- 统计数据集格式与覆盖范围:整理文件格式、文件大小、覆盖区域和时间周期,数据资源选型与采购决策。
- 核验搜索结果准确性:结合
check_url、xpath和排名字段复核 SERP 抓取结果,为 SEO 监控和数据审计提供依据。