Skip to content

获取 Google Dataset Info Advanced 结果 ​

接口说明 ​

GET /v3/serp/google/dataset_info/task_get/advanced/$id

根据任务 ID 获取 Google Dataset Info Advanced 任务结果。任务提交后,可在 30 天重复获取结果;获取结果本身不额外收费,扣费以响应头 X-SeerMarTech-Charge-CNY 为准。

请求参数 ​

请求方式为 GET,无需请求体。

参数类型说明
idstring任务唯一标识,UUID 格式。任务提交后可在 30 天使用该 ID 获取结果。

响应说明 ​

接口返回 JSON 数据 tasks 数组。

顶层字段 ​

字段类型说明
versionstring当前 API 版本。
status_codeinteger通用响应状态码。
status_messagestring通用状态说明。
timestring请求执行耗时,单位为秒。
costfloat平台原始 USD 成本兼容字段;人民币实扣以 X-SeerMarTech-Charge-CNY 为准。
tasks_countintegertasks 数组中的任务数量。
tasks_errorintegertasks 数组中返回错误的任务数量。
tasksarray任务结果数组。

tasks 数组字段 ​

字段类型说明
idstring任务唯一标识,UUID 格式。
status_codeinteger任务状态码,通常为 10000 至 60000。
status_messagestring任务状态说明。
timestring任务执行耗时,单位为秒。
costfloat平台原始 USD 成本兼容字段;人民币实扣以 X-SeerMarTech-Charge-CNY 为准。
result_countintegerresult 数组中的数量。
patharray请求 URL 路径。
dataobject创建任务时提交的参数。
resultarray任务结果数组。

result 数组字段 ​

字段类型说明
keywordstringPOST 请求中提交的。返回时会解码 %##;加号(+)会被解码为空格。
se_domainstringPOST 请求中提交的搜索引擎域名。
language_codestringPOST 请求中提交的语言代码。
check_urlstring搜索引擎结果页的直接 URL,可用于核验结果准确性。
datetimestring获取结果的日期和时间,使用 UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。
spellobject搜索引擎自动纠错信息。当搜索引擎对进行纠正时,返回纠正后的及纠错类型。
refinement_chipsobject搜索结果细化选项。
item_typesarraySERP 中出现的结果类型。该接口可能返回 dataset。
se_results_countintegerSERP 中的结果总数。
items_countintegeritems 数组中的结果数量。
itemsarraySERP 中的 Dataset 结果。

items 数组字段 ​

字段类型说明
typestring素类型,固定为 dataset。
rank_groupinteger分组排名。在类型相同的组排名;不同类型的位置不会计此字段。
rank_absoluteintegerSERP 中的绝对排名,即所有结果中的位置。
positionstring素在 SERP 中的对齐位置,可为 left 或 right。
xpathstring结果的 XPath。
dataset_idstring数据集 ID。
titlestringSERP 中显示的数据集标题。
image_urlstring图片 URL。通常指向原始资源中的图片;如果原始来源不可用,则可能指向本平台存储的图片。
scholarly_citations_countinteger引用该数据集的文章数量。
linksarray站点链接,即部分 Google Dataset 结果下方显示的链接;没有链接时为 null。
dataset_providersarray提供该数据集的机构列表。
formatsarray数据集文件格式列表。
authorsarray数据集列表。
licensesarray数据集许可证列表。
updated_datestring结果最近更新时间,使用 UTC 格式。
area_coveredarray数据集覆盖区域,例如 Africa、Global。
period_coveredobject数据集覆盖的时间范围。
dataset_descriptionobject数据集描述信息。
字段类型说明
typestring素类型,固定为 link_element。
titlestring链接标题。
descriptionstringSERP 结果描述。
urlstring站点链接 URL。
domainstringSERP 中显示的域名。

dataset_providers 字段 ​

字段类型说明
typestring素类型,固定为 dataset_providers_element。
titlestring数据集提供方名称。
urlstring数据集提供方网站 URL。
domainstring数据集提供方网站域名。

formats 字段 ​

字段类型说明
typestring素类型,固定为 formats_element。
formatstring文件格式,例如 zip、html、csv。
sizestring文件大小,单位为字节。

authors 字段 ​

字段类型说明
typestring素类型,固定为 authors_element。
namestring数据集名称。
urlstring链接 URL。
domainstring链接域名。

licenses 字段 ​

字段类型说明
typestring素类型,固定为 licenses_element。
titlestring许可证名称。
urlstring许可证 URL。
domainstring许可证 URL 指向的域名。

period_covered 字段 ​

字段类型说明
start_datestring覆盖周期开始时间,UTC 格式。
end_datestring覆盖周期结束时间,UTC 格式。
displayed_datestringSERP 中展示的时间范围,例如 Mar 2, 2020 - Dec 9, 2022。

dataset_description 字段 ​

字段类型说明
textstring数据集描述文本。
linksarray描述文本中的链接列表。

dataset_description.links 中的字段如下:

字段类型说明
typestring素类型,固定为 link_element。
titlestring链接锚文本。
descriptionstringSERP 结果描述。
urlstring链接 URL。
domainstringSERP 中显示的域名。

请求示例 ​

cURL ​

bash
id="02261816-2027-0066-0000-c27d02864073"

curl --location --request GET \
  "https://api.seermartech.cn/v3/serp/google/dataset_info/task_get/advanced/${id}" \
  --header "Authorization: Bearer smt_live_YOUR_KEY" \
  --header "Content-Type: application/json"

PHP ​

php
<?php

$apiUrl = 'https://api.seermartech.cn/';
$taskId = '02261816-2027-0066-0000-c27d02864073';

$ch = curl_init(
    $apiUrl . 'v3/serp/google/dataset_info/task_get/advanced/' . $taskId
);

curl_setopt_array($ch, [
    CURLOPT_RETURNTRANSFER => true,
    CURLOPT_HTTPHEADER => [
        'Authorization: Bearer smt_live_YOUR_KEY',
        'Content-Type: application/json',
    ],
]);

$response = curl_exec($ch);

if ($response === false) {
    throw new RuntimeException(curl_error($ch));
}

curl_close($ch);

$result = json_decode($response, true);
print_r($result);

TypeScript ​

typescript
import axios from "axios";

const taskId = "02231256-2604-0066-2000-57133b8fc54e";

axios
  .get(
    `https://api.seermartech.cn/v3/serp/google/dataset_info/task_get/advanced/${taskId}`,
    {
      headers: {
        Authorization: "Bearer smt_live_YOUR_KEY",
        "Content-Type": "application/json",
      },
    }
  )
  .then((response) => {
    // 处理接口返回的数据
    console.log(response.data);
  })
  .catch((error) => {
    console.error(error.response?.data ?? error.message);
  });

Python ​

python
import requests

task_id = "02231256-2604-0066-0000-c27d02864073"
url = (
    "https://api.seermartech.cn/v3/serp/google/"
    f"dataset_info/task_get/advanced/{task_id}"
)

response = requests.get(
    url,
    headers={
        "Authorization": "Bearer smt_live_YOUR_KEY",
        "Content-Type": "application/json",
    },
)

if response.ok:
    result = response.json()
    print(result)
else:
    print(f"请求失败:HTTP {response.status_code},{response.text}")

响应示例 ​

json
{
  "version": "0.1.20221214",
  "status_code": 20000,
  "status_message": "Ok.",
  "time": "0.0729 sec.",
  "cost": 0,
  "tasks_count": 1,
  "tasks_error": 0,
  "tasks": [
    {
      "id": "02261816-2027-0066-0000-c27d02864073",
      "status_code": 20000,
      "status_message": "Ok.",
      "time": "0.0729 sec.",
      "cost": 0,
      "result_count": 1,
      "path": [
        "v3",
        "serp",
        "google",
        "dataset_info",
        "task_get",
        "advanced"
      ],
      "data": {
        "api": "serp",
        "function": "task_get",
        "se": "google",
        "se_type": "dataset_info",
        "dataset_id": "L2cvMTFqbl85ZHN6MQ==",
        "device": "desktop",
        "os": "windows"
      },
      "result": [
        {
          "se_results_count": 1,
          "items_count": 1,
          "items": [
            {
              "type": "dataset",
              "rank_group": 1,
              "rank_absolute": 1,
              "position": "left",
              "xpath": "/html/body/div[1]",
              "dataset_id": "L2cvMTFqbl85ZHN6MQ==",
              "title": "Water quality in Canadian rivers",
              "image_url": null,
              "scholarly_citations_count": 12,
              "links": null,
              "dataset_providers": [],
              "formats": [],
              "authors": null,
              "licenses": [],
              "updated_date": "2019-06-24 03:00:00 +00:00",
              "area_covered": null,
              "period_covered": {
                "start_date": "2002-01-01 02:00:00 +00:00",
                "end_date": "2017-12-31 02:00:00 +00:00",
                "displayed_date": "Jan 1, 2002 - Dec 31, 2017"
              },
              "dataset_description": {
                "text": "The Canadian Environmental Sustainability Indicators program provides data and information to track Canada's performance on key environmental sustainability issues.",
                "links": []
              }
            }
          ]
        }
      ]
    }
  ]
}

状态码与错误处理 ​

请根据顶层 status_code 和任务级 tasks[].status_code 判断请求是否成功:

  • 20000:请求或任务处理成功。
  • 40000 及以上:任务处理失败或返回错误,应结合 status_message 排查。
  • 当 result 为 null 或不存在时,不应继续按成功结果处理。
  • 建议在业务系统中针对网络异常、任务失败、结果为空和响应时建立重试及异常处理机制。

实用场景 ​

  • 监测数据集 SERP 展现:批量获取 Google Dataset 结果及排名信息,评估数据集在目标下的可见度。
  • 分析数据集信息:提取数据集标题、描述、、许可证和更新时间,支持数据资源质量评估。
  • 追踪数据集来源机构:识别数据集提供方及官网域名,构建行业数据供应商与权威来源单。
  • 统计数据集格式与覆盖范围:整理文件格式、文件大小、覆盖区域和时间周期,数据资源选型与采购决策。
  • 核验搜索结果准确性:结合 check_url、xpath 和排名字段复核 SERP 抓取结果,为 SEO 监控和数据审计提供依据。

统一入口:官网 · LLM API · 控制台