Skip to content

获取 Google Dataset Search 高级结果(按任务 ID)

接口说明

用于根据任务 ID 获取 Google Dataset Search 的高级结果。

请求方式

GET https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/$id

计费说明

本接口在创建任务时计费,任务结果在返回后的 30 天可重复获取

扣费以响应头 X-SeerMarTech-Charge-CNY 为准。

路径参数

字段类型说明
idstring任务唯一标识,UUID 格式。可在任务创建后 30 天随时用于获取结果。

返回结构

接口返回 JSON 数据,顶层 tasks 数组每个对应一个任务的执行结果。

顶层字段

字段类型说明
versionstring当前 API 版本。
status_codeinteger通用状态码。完整状态码请参考错误码说明。建议对异常和错误状态建立完善的处理机制。
status_messagestring通用提示信息。
timestring执行耗时,单位秒。
costfloat本次请求总成本,单位 USD。
tasks_countintegertasks 数组中的任务数。
tasks_errorintegertasks 数组中返回错误的任务数。
tasksarray任务结果数组。

tasks[] 字段

字段类型说明
idstring任务 ID,UUID 格式。
status_codeinteger任务状态码,范围通常为 10000-60000
status_messagestring任务状态信息。
timestring任务执行耗时,单位秒。
costfloat该任务成本,单位 USD。
result_countintegerresult 数组中的数量。
patharray请求路径。
dataobject与 POST 创建任务时传的参数一致。
resultarray结果数组。

result[] 字段

字段类型说明
keywordstringPOST 请求中提交的。返回时会解码 %##+ 会被转换为空格。
se_domainstringPOST 请求中的搜索引擎域名。
language_codestringPOST 请求中的语言代码。
check_urlstring结果页直达链接,可用于人工校验抓取结果是否准确。
datetimestring结果抓取时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00
spellobject搜索引擎自动纠错信息。如果搜索结果基于纠正后的生成,这里会返回纠错后的及纠错类型。
refinement_chipsobject搜索细化选项。
item_typesarray当前 SERP 中出现的结果类型。该接口可能返回的类型:dataset
se_results_countintegerSERP 总结果数。
items_countintegeritems 数组中返回的结果数量。
itemsarraySERP 中识别出的结果项。

refinement_chips 字段

字段类型说明
typestring素类型,固定为 refinement_chips
xpathstring素的 XPath。
itemsarray细化选项列表。

refinement_chips.items[]

字段类型说明
typestring素类型,固定为 refinement_chips_element
titlestring选项标题。
urlstring带细化参数的搜索 URL。
domainstringSERP 中显示的域名。
optionsarray进一步细化选项。

refinement_chips.items[].options[]

字段类型说明
typestring素类型,固定为 refinement_chips_option
titlestring选项标题。
urlstring带细化参数的搜索 URL。
domainstringSERP 中显示的域名。

数据集结果项说明

items[] 中每个通常是一个 dataset 类型结果。

items[] 通用字段

字段类型说明
typestring素类型,固定为 dataset
rank_groupinteger同类型结果的组排名。不同类型结果不会计该值。
rank_absoluteinteger在整个 SERP 中的绝对排名。
positionstring结果在页面中的位置,可选值:leftright
xpathstring素的 XPath。
dataset_idstring数据集 ID。
titlestringSERP 中显示的标题。
image_urlstring图片地址。若原始图片不可用,可能返回平台缓存地址。
scholarly_citations_countinteger引用该数据集的学术文章数量。
scholarly_articles_urlstring学术文章链接,通常指向学术搜索结果页。
unique_identifierstring数据集的唯一数字标识,例如 DOI。
related_articlestring与该数据集的已发表文章链接。
linksarray站点链接;若无则为 null
dataset_providersarray数据集提供机构列表。
formatsarray数据集文件格式列表。
authorsarray数据集列表。
licensesarray数据集许可证列表。
updated_datestring结果最后更新时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00
area_coveredarray数据集覆盖区域列表,例如 AfricaGlobal
period_coveredobject数据集覆盖时间范围。
dataset_descriptionobject数据集描述信息。
字段类型说明
typestring素类型,固定为 link_element
titlestring链接标题。
descriptionstring结果描述。
urlstring站点链接 URL。
domainstringSERP 中显示的域名。

dataset_providers[]

字段类型说明
typestring素类型,固定为 dataset_providers_element
titlestring数据集提供方名称。
urlstring提供方站点链接。
domainstring提供方域名。

formats[]

字段类型说明
typestring素类型,固定为 formats_element
formatstring文件格式,例如 ziphtmlcsv
sizestring文件大小,单位字节。

authors[]

字段类型说明
typestring素类型,固定为 authors_element
namestring名称。
urlstring链接地址。
domainstring链接域名。

licenses[]

字段类型说明
typestring素类型,固定为 licenses_element
titlestring许可证名称。
urlstring许可证链接。
domainstring许可证页面域名。

period_covered

字段类型说明
start_datestring开始时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00
end_datestring结束时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00
displayed_datestringSERP 中展示的时间范围文本。

dataset_description

字段类型说明
textstring数据集描述文本。
linksarray描述文本中的链接。
字段类型说明
typestring素类型,固定为 link_element
titlestring链接锚文本。
descriptionstring结果描述。
urlstring链接地址。
domainstring域名。

沙箱调试

如需查看该端点可能返回的 SERP素结构,可调用沙箱接口:

https://sandbox.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/00000000-0000-0000-0000-000000000000

沙箱响应会返回该高级端点下所有可用字段,并填模拟数据。调用沙箱接口不会产生费用。

请求示例

curl

bash
id="02261816-2027-0066-0000-c27d02864073"

curl --location --request GET "https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/${id}" \
--header "Authorization: Bearer smt_live_YOUR_KEY" \
--header "Content-Type: application/json"

Python

python
import requests

task_id = "02231256-2604-0066-2000-57133b8fc54e"

url = f"https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/{task_id}"
headers = {
 "Authorization": "Bearer smt_live_YOUR_KEY",
 "Content-Type": "application/json"
}

response = requests.get(url, headers=headers)
print(response.json)

TypeScript

typescript
import axios from "axios";

const taskId = "02231256-2604-0066-2000-57133b8fc54e";

axios({
 method: "get",
 url: `https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/${taskId}`,
 headers: {
 Authorization: "Bearer smt_live_YOUR_KEY",
 "Content-Type": "application/json",
 },
}).then((response) => {
 // 返回结果
 console.log(response.data);
}).catch((error) => {
 console.error(error);
});

响应示例

json
{
 "version": "0.1.20230825",
 "status_code": 20000,
 "status_message": "Ok.",
 "time": "0.1023 sec.",
 "cost": 0,
 "tasks_count": 1,
 "tasks_error": 0,
 "tasks": [
 {
 "data": {
 "api": "serp",
 "function": "task_get",
 "se": "google",
 "se_type": "dataset_search",
 "keyword": "water quality",
 "last_updated": "1m",
 "file_formats": [],
 "usage_rights": "noncommercial",
 "is_free": true,
 "topics": [],
 "device": "desktop",
 "os": "windows"
 },
 "result": [
 {
 "se_results_count": 27,
 "items_count": 20,
 "items": [
 {
 "dataset_providers": null,
 "formats": [],
 "authors": [],
 "licenses": [],
 "updated_date": "2023-10-03 03:00:00 +00:00",
 "area_covered": null,
 "period_covered": null,
 "dataset_description": {
 "text": "The \"Watershed Water Quality - Wastewater\" dataset is a comprehensive collection of routine wastewater treatment plant monitoring results spanning from 1987 to the present day.",
 "links": null
 }
 },
 {
 "type": "dataset",
 "rank_group": 2,
 "rank_absolute": 2,
 "position": "left",
 "xpath": null,
 "dataset_id": "L2cvMTFuMDQ3dnFsZw==",
 "title": "Georgian Bay Water Quality",
 "image_url": "https://encrypted-tbn3.gstatic.com/images?q=tbn:ANd9GcSqDwx-mgL3ad2LqHoJnRHdauU8eFxZr0vxuVzMxnDWOKp2JiGd",
 "scholarly_citations_count": 4,
 "scholarly_articles_url": "https://scholar.google.com/scholar?q=%22georgian%20bay%20water%20quality%22",
 "unique_identifier": null,
 "related_article": null,
 "links": [],
 "dataset_providers": [],
 "formats": [],
 "authors": null,
 "licenses": [],
 "updated_date": "2023-10-18 03:00:00 +00:00",
 "area_covered": [],
 "period_covered": {
 "start_date": "2003-01-01 02:00:00 +00:00",
 "end_date": "2005-12-31 02:00:00 +00:00",
 "displayed_date": "Jan 1, 2003 - Dec 31, 2005"
 },
 "dataset_description": {
 "text": "135 locations from Killarney to Honey Harbour were surveyed between 2003 and 2005.",
 "links": null
 }
 }
 ]
 }
 ]
 }
 ]
}

状态码与错误处理

  • 顶层 status_code 表示请求整体状态。
  • tasks[].status_code 表示单个任务状态。
  • 建议同时校验:
  • HTTP 状态码
  • 顶层 status_code
  • tasks[].status_code
  • result 是否为空

tasks[].status_code 大于等于 40000,或 result 为空时,应按失败任务处理。

使用建议

  1. 通过创建任务接口创建 Google Dataset Search 任务。
  2. 可通过 /v3/serp/google/dataset_search/tasks_ready 获取已完成任务列表。
  3. 再调用 /v3/serp/google/dataset_search/task_get/advanced/$id 拉取高级结果。
  4. 若需要更丰富的字段明细,优使用 advanced 结果而非简化结果。
  5. dataset_idunique_identifierdataset_providersformatsupdated_date 等字段库,便于后续做数据资产分析与检索。

实用场景

  • 监控数据集可见性:跟踪指定主题下的数据集排名、标题和展示数量,评估机构数据资源在搜索结果中的。
  • 挖掘数据资源:基于 dataset_providersformatslicenses 等字段筛选可用数据集,快速建立行业数据源单。
  • 分析学术度:结合 scholarly_citations_countscholarly_articles_url,识别被学术论文广泛引用的数据集,选题和研究支持。
  • 识别数据时效性:通过 updated_dateperiod_covered 判断数据集是否持续维护,优选择更新频率高、覆盖周期完整的数据资源。
  • 构建专题数据导航页:提取 titledataset_descriptionformatsauthorsrelated_article 等字段,生成面向水质、环境、地理等专题的数据聚合页面。

统一入口:官网 · LLM API · 控制台