主题
获取 Google Dataset Search 高级结果(按任务 ID)
接口说明
用于根据任务 ID 获取 Google Dataset Search 的高级结果。
请求方式
GET https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/$id
计费说明
本接口在创建任务时计费,任务结果在返回后的 30 天可重复获取。
扣费以响应头 X-SeerMarTech-Charge-CNY 为准。
路径参数
| 字段 | 类型 | 说明 |
|---|---|---|
id | string | 任务唯一标识,UUID 格式。可在任务创建后 30 天随时用于获取结果。 |
返回结构
接口返回 JSON 数据,顶层 tasks 数组每个对应一个任务的执行结果。
顶层字段
| 字段 | 类型 | 说明 |
|---|---|---|
version | string | 当前 API 版本。 |
status_code | integer | 通用状态码。完整状态码请参考错误码说明。建议对异常和错误状态建立完善的处理机制。 |
status_message | string | 通用提示信息。 |
time | string | 执行耗时,单位秒。 |
cost | float | 本次请求总成本,单位 USD。 |
tasks_count | integer | tasks 数组中的任务数。 |
tasks_error | integer | tasks 数组中返回错误的任务数。 |
tasks | array | 任务结果数组。 |
tasks[] 字段
| 字段 | 类型 | 说明 |
|---|---|---|
id | string | 任务 ID,UUID 格式。 |
status_code | integer | 任务状态码,范围通常为 10000-60000。 |
status_message | string | 任务状态信息。 |
time | string | 任务执行耗时,单位秒。 |
cost | float | 该任务成本,单位 USD。 |
result_count | integer | result 数组中的数量。 |
path | array | 请求路径。 |
data | object | 与 POST 创建任务时传的参数一致。 |
result | array | 结果数组。 |
result[] 字段
| 字段 | 类型 | 说明 |
|---|---|---|
keyword | string | POST 请求中提交的。返回时会解码 %##, + 会被转换为空格。 |
se_domain | string | POST 请求中的搜索引擎域名。 |
language_code | string | POST 请求中的语言代码。 |
check_url | string | 结果页直达链接,可用于人工校验抓取结果是否准确。 |
datetime | string | 结果抓取时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。 |
spell | object | 搜索引擎自动纠错信息。如果搜索结果基于纠正后的生成,这里会返回纠错后的及纠错类型。 |
refinement_chips | object | 搜索细化选项。 |
item_types | array | 当前 SERP 中出现的结果类型。该接口可能返回的类型:dataset。 |
se_results_count | integer | SERP 总结果数。 |
items_count | integer | items 数组中返回的结果数量。 |
items | array | SERP 中识别出的结果项。 |
refinement_chips 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 refinement_chips。 |
xpath | string | 素的 XPath。 |
items | array | 细化选项列表。 |
refinement_chips.items[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 refinement_chips_element。 |
title | string | 选项标题。 |
url | string | 带细化参数的搜索 URL。 |
domain | string | SERP 中显示的域名。 |
options | array | 进一步细化选项。 |
refinement_chips.items[].options[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 refinement_chips_option。 |
title | string | 选项标题。 |
url | string | 带细化参数的搜索 URL。 |
domain | string | SERP 中显示的域名。 |
数据集结果项说明
items[] 中每个通常是一个 dataset 类型结果。
items[] 通用字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 dataset。 |
rank_group | integer | 同类型结果的组排名。不同类型结果不会计该值。 |
rank_absolute | integer | 在整个 SERP 中的绝对排名。 |
position | string | 结果在页面中的位置,可选值:left、right。 |
xpath | string | 素的 XPath。 |
dataset_id | string | 数据集 ID。 |
title | string | SERP 中显示的标题。 |
image_url | string | 图片地址。若原始图片不可用,可能返回平台缓存地址。 |
scholarly_citations_count | integer | 引用该数据集的学术文章数量。 |
scholarly_articles_url | string | 学术文章链接,通常指向学术搜索结果页。 |
unique_identifier | string | 数据集的唯一数字标识,例如 DOI。 |
related_article | string | 与该数据集的已发表文章链接。 |
links | array | 站点链接;若无则为 null。 |
dataset_providers | array | 数据集提供机构列表。 |
formats | array | 数据集文件格式列表。 |
authors | array | 数据集列表。 |
licenses | array | 数据集许可证列表。 |
updated_date | string | 结果最后更新时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。 |
area_covered | array | 数据集覆盖区域列表,例如 Africa、Global。 |
period_covered | object | 数据集覆盖时间范围。 |
dataset_description | object | 数据集描述信息。 |
links[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 link_element。 |
title | string | 链接标题。 |
description | string | 结果描述。 |
url | string | 站点链接 URL。 |
domain | string | SERP 中显示的域名。 |
dataset_providers[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 dataset_providers_element。 |
title | string | 数据集提供方名称。 |
url | string | 提供方站点链接。 |
domain | string | 提供方域名。 |
formats[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 formats_element。 |
format | string | 文件格式,例如 zip、html、csv。 |
size | string | 文件大小,单位字节。 |
authors[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 authors_element。 |
name | string | 名称。 |
url | string | 链接地址。 |
domain | string | 链接域名。 |
licenses[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 licenses_element。 |
title | string | 许可证名称。 |
url | string | 许可证链接。 |
domain | string | 许可证页面域名。 |
period_covered
| 字段 | 类型 | 说明 |
|---|---|---|
start_date | string | 开始时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。 |
end_date | string | 结束时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。 |
displayed_date | string | SERP 中展示的时间范围文本。 |
dataset_description
| 字段 | 类型 | 说明 |
|---|---|---|
text | string | 数据集描述文本。 |
links | array | 描述文本中的链接。 |
dataset_description.links[]
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 link_element。 |
title | string | 链接锚文本。 |
description | string | 结果描述。 |
url | string | 链接地址。 |
domain | string | 域名。 |
沙箱调试
如需查看该端点可能返回的 SERP素结构,可调用沙箱接口:
https://sandbox.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/00000000-0000-0000-0000-000000000000
沙箱响应会返回该高级端点下所有可用字段,并填模拟数据。调用沙箱接口不会产生费用。
请求示例
curl
bash
id="02261816-2027-0066-0000-c27d02864073"
curl --location --request GET "https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/${id}" \
--header "Authorization: Bearer smt_live_YOUR_KEY" \
--header "Content-Type: application/json"Python
python
import requests
task_id = "02231256-2604-0066-2000-57133b8fc54e"
url = f"https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/{task_id}"
headers = {
"Authorization": "Bearer smt_live_YOUR_KEY",
"Content-Type": "application/json"
}
response = requests.get(url, headers=headers)
print(response.json)TypeScript
typescript
import axios from "axios";
const taskId = "02231256-2604-0066-2000-57133b8fc54e";
axios({
method: "get",
url: `https://api.seermartech.cn/v3/serp/google/dataset_search/task_get/advanced/${taskId}`,
headers: {
Authorization: "Bearer smt_live_YOUR_KEY",
"Content-Type": "application/json",
},
}).then((response) => {
// 返回结果
console.log(response.data);
}).catch((error) => {
console.error(error);
});响应示例
json
{
"version": "0.1.20230825",
"status_code": 20000,
"status_message": "Ok.",
"time": "0.1023 sec.",
"cost": 0,
"tasks_count": 1,
"tasks_error": 0,
"tasks": [
{
"data": {
"api": "serp",
"function": "task_get",
"se": "google",
"se_type": "dataset_search",
"keyword": "water quality",
"last_updated": "1m",
"file_formats": [],
"usage_rights": "noncommercial",
"is_free": true,
"topics": [],
"device": "desktop",
"os": "windows"
},
"result": [
{
"se_results_count": 27,
"items_count": 20,
"items": [
{
"dataset_providers": null,
"formats": [],
"authors": [],
"licenses": [],
"updated_date": "2023-10-03 03:00:00 +00:00",
"area_covered": null,
"period_covered": null,
"dataset_description": {
"text": "The \"Watershed Water Quality - Wastewater\" dataset is a comprehensive collection of routine wastewater treatment plant monitoring results spanning from 1987 to the present day.",
"links": null
}
},
{
"type": "dataset",
"rank_group": 2,
"rank_absolute": 2,
"position": "left",
"xpath": null,
"dataset_id": "L2cvMTFuMDQ3dnFsZw==",
"title": "Georgian Bay Water Quality",
"image_url": "https://encrypted-tbn3.gstatic.com/images?q=tbn:ANd9GcSqDwx-mgL3ad2LqHoJnRHdauU8eFxZr0vxuVzMxnDWOKp2JiGd",
"scholarly_citations_count": 4,
"scholarly_articles_url": "https://scholar.google.com/scholar?q=%22georgian%20bay%20water%20quality%22",
"unique_identifier": null,
"related_article": null,
"links": [],
"dataset_providers": [],
"formats": [],
"authors": null,
"licenses": [],
"updated_date": "2023-10-18 03:00:00 +00:00",
"area_covered": [],
"period_covered": {
"start_date": "2003-01-01 02:00:00 +00:00",
"end_date": "2005-12-31 02:00:00 +00:00",
"displayed_date": "Jan 1, 2003 - Dec 31, 2005"
},
"dataset_description": {
"text": "135 locations from Killarney to Honey Harbour were surveyed between 2003 and 2005.",
"links": null
}
}
]
}
]
}
]
}状态码与错误处理
- 顶层
status_code表示请求整体状态。 tasks[].status_code表示单个任务状态。- 建议同时校验:
- HTTP 状态码
- 顶层
status_code tasks[].status_coderesult是否为空
当 tasks[].status_code 大于等于 40000,或 result 为空时,应按失败任务处理。
使用建议
- 通过创建任务接口创建 Google Dataset Search 任务。
- 可通过
/v3/serp/google/dataset_search/tasks_ready获取已完成任务列表。 - 再调用
/v3/serp/google/dataset_search/task_get/advanced/$id拉取高级结果。 - 若需要更丰富的字段明细,优使用
advanced结果而非简化结果。 - 将
dataset_id、unique_identifier、dataset_providers、formats、updated_date等字段库,便于后续做数据资产分析与检索。
实用场景
- 监控数据集可见性:跟踪指定主题下的数据集排名、标题和展示数量,评估机构数据资源在搜索结果中的。
- 挖掘数据资源:基于
dataset_providers、formats、licenses等字段筛选可用数据集,快速建立行业数据源单。 - 分析学术度:结合
scholarly_citations_count和scholarly_articles_url,识别被学术论文广泛引用的数据集,选题和研究支持。 - 识别数据时效性:通过
updated_date与period_covered判断数据集是否持续维护,优选择更新频率高、覆盖周期完整的数据资源。 - 构建专题数据导航页:提取
title、dataset_description、formats、authors、related_article等字段,生成面向水质、环境、地理等专题的数据聚合页面。