主题
Google Dataset Search 实时高级结果
POST /v3/serp/google/dataset_search/live/advanced
本接口通过实时检索获取 Google Dataset Search 针对指定的结果,默认返回前 20 条数据集结果,并支持按更新时间、文件格式、使用权利、是否及主题等条件筛选。
请求方法与路径:
http
POST https://api.seermartech.cn/v3/serp/google/dataset_search/live/advanced接口说明
- 请求体使用 UTF-8 编码的 JSON 格式。
- 请求体是 JSON 数组,例如
[{ ... }]。 - 每个请求只能 1 个任务。 平台限流以认证说明中的 30/60/120 次/分钟规则为准。
- 实时结果按请求计费。
depth默认返回 20 条结果, 20 条时可能产生额外费用。- 实扣费以响应头
X-SeerMarTech-Charge-CNY为准。 - 参考价约 ¥0.0144 / 次(对应示例响应中的 0.002 美成本作换算参考)。
请求参数
###填及主要参数
| 字段 | 类型 | 填 | 说明 |
|---|---|---|---|
keyword | string | 是 | Dataset Search 查询,最多 700 个字符。返回结果中的会对 URL 编码进行解码:%## 会被解码,字符 + 会被解码为空格。若中需要使用 %,请写作 %25;若需要使用 +,请写作 %2B。 |
language_code | string | 否 | 搜索引擎语言代码。使用该字段时无需传 language_name。可选值:en。 |
depth | integer | 否 | 解析深度,即希望获取的结果数量。默认值为 20,最大值为 200。当指定值大于 20 时,若搜索引擎返回 20 条结果,可能按多个结果页计费;若返回数量少于指定值,未返回部分对应的费用会自动退还。 |
device | string | 否 | 设备类型。可选值:desktop。 |
> language_code 和 language_name 二选一即可。
高级筛选参数
| 字段 | 类型 | 填 | 说明 |
|---|---|---|---|
language_name | string | 否 | 搜索引擎语言名称。使用该字段时无需传 language_code。可选值:English。 |
os | string | 否 | 设备操作系统。可选值:windows、macos,默认值为 windows。 |
tag | string | 否 | 用户自定义任务标识,最多 255 个字符。可用于任务和结果;提交的值会原样返回在响应任务的 data 对象中。 |
last_updated | string | 否 | 数据集最近更新时间范围。可选值:1m(最近 1 个月)、1y(最近 1 年)、3y(最近 3 年)。 |
file_formats | array | 否 | 数据集文件格式分类。可选值:other、archive、text、image、document、tabular。 |
usage_rights | string | 否 | 数据集使用权利。可选值:commercial、noncommercial。 |
is_free | boolean | 否 | 是否返回数据集。可选值:true、false。 |
topics | array | 否 | 数据集主题。可选值:humanities、social_sciences、life_sciences、agriculture、natural_sciences、geo、computer、architecture_and_urban_planning、engineering。 |
请求示例
cURL
bash
curl --location --request POST \
"https://api.seermartech.cn/v3/serp/google/dataset_search/live/advanced" \
--header "Authorization: Bearer smt_live_YOUR_KEY" \
--header "Content-Type: application/json" \
--data-raw '[
{
"keyword": "water quality",
"language_code": "en",
"depth": 20,
"device": "desktop",
"os": "windows",
"last_updated": "1m",
"file_formats": ["tabular", "document"],
"usage_rights": "noncommercial",
"is_free": true,
"topics": ["natural_sciences"],
"tag": "water-quality-datasets"
}
]'Python
python
import requests
url = "https://api.seermartech.cn/v3/serp/google/dataset_search/live/advanced"
headers = {
"Authorization": "Bearer smt_live_YOUR_KEY",
"Content-Type": "application/json",
}
payload = [
{
"keyword": "water quality",
"last_updated": "1m",
"file_formats": ["tabular"],
"usage_rights": "noncommercial",
"is_free": True,
"topics": ["natural_sciences"],
}
]
response = requests.post(url, headers=headers, json=payload)
result = response.json()
if result.get("status_code") == 20000:
print(result)
else:
print(
f"请求失败,状态码:{result.get('status_code')},"
f"消息:{result.get('status_message')}"
)TypeScript
typescript
import axios from "axios";
const response = await axios.post(
"https://api.seermartech.cn/v3/serp/google/dataset_search/live/advanced",
[
{
keyword: "water quality",
last_updated: "1m",
file_formats: ["tabular"],
usage_rights: "noncommercial",
is_free: true,
topics: ["natural_sciences"],
},
],
{
headers: {
Authorization: "Bearer smt_live_YOUR_KEY",
"Content-Type": "application/json",
},
}
);
const result = response.data;
if (result.status_code === 20000) {
console.log(result);
} else {
console.error(result.status_code, result.status_message);
}响应结构
响应为 JSON 对象,主要结构如下:
json
{
"version": "0.1.20230825",
"status_code": 20000,
"status_message": "Ok.",
"time": "3.0987 sec.",
"cost": 0.0144,
"tasks_count": 1,
"tasks_error": 0,
"tasks": [
{
"id": "UUID",
"status_code": 20000,
"status_message": "Ok.",
"time": "3.0987 sec.",
"cost": 0.0144,
"result_count": 1,
"path": [
"v3",
"serp",
"google",
"dataset_search",
"live",
"advanced"
],
"data": {
"api": "serp",
"function": "live",
"se": "google",
"se_type": "dataset_search",
"keyword": "water quality",
"last_updated": "1m",
"file_formats": ["tabular"],
"usage_rights": "noncommercial",
"is_free": true,
"topics": ["natural_sciences"],
"device": "desktop",
"os": "windows"
},
"result": [
{
"keyword": "water quality",
"se_domain": "google.com",
"language_code": "en",
"check_url": "https://www.google.com/search?q=water+quality",
"datetime": "2023-10-21 03:00:00 +00:00",
"se_results_count": 27,
"items_count": 20,
"item_types": ["dataset"],
"items": [
{
"type": "dataset",
"rank_group": 1,
"rank_absolute": 1,
"position": "left",
"dataset_id": "L2cvMTFuMDQ3dnFsZw==",
"title": "Water Quality Dataset",
"image_url": null,
"scholarly_citations_count": 4,
"scholarly_articles_url": null,
"unique_identifier": null,
"related_article": null,
"links": [],
"dataset_providers": [],
"formats": [],
"authors": [],
"licenses": [],
"updated_date": "2023-10-03 03:00:00 +00:00",
"area_covered": ["Global"],
"period_covered": {
"start_date": "2020-01-01 00:00:00 +00:00",
"end_date": "2022-12-31 00:00:00 +00:00",
"displayed_date": "Jan 1, 2020 - Dec 31, 2022"
},
"dataset_description": {
"text": "Dataset description",
"links": []
}
}
]
}
]
}
]
}> 上述 cost 为示例中的人民币换算展示值;扣费以响应头 X-SeerMarTech-Charge-CNY 为准。
响应字段说明
顶层字段
| 字段 | 类型 | 说明 |
|---|---|---|
version | string | 当前 API 版本。 |
status_code | integer | 请求级状态码。完整状态码列表请参考错误码文档。 |
status_message | string | 请求级说明信息。 |
time | string | 请求执行耗时,单位为秒。 |
cost | float | 平台原始 USD 成本兼容字段;人民币实扣以 X-SeerMarTech-Charge-CNY 为准。 |
tasks_count | integer | tasks 数组中的任务总数。 |
tasks_error | integer | tasks 数组中执行失败的任务数。 |
tasks | array | 任务结果数组。 |
任务字段
| 字段 | 类型 | 说明 |
|---|---|---|
id | string | 任务唯一标识,UUID 格式。 |
status_code | integer | 任务状态码,通常在 10000–60000 范围。 |
status_message | string | 任务状态说明。 |
time | string | 任务执行耗时,单位为秒。 |
cost | float | 平台原始 USD 成本兼容字段;人民币实扣以 X-SeerMarTech-Charge-CNY 为准。 |
result_count | integer | result 数组中的数量。 |
path | array | 请求 API 的 URL 路径组成部分。 |
data | object | 请求中提交的任务参数,部分默认参数也可能出现在此对象中。 |
result | array | 搜索结果数组。 |
搜索结果字段
| 字段 | 类型 | 说明 |
|---|---|---|
keyword | string | 请求中的。返回时已对 %## 进行解码,字符 + 会还原为空格。 |
se_domain | string | 搜索引擎域名。 |
language_code | string | 搜索引擎语言代码。 |
check_url | string | 对应搜索结果页面的直接 URL,可用于核验结果准确性。 |
datetime | string | 获取结果的时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。 |
spell | object | 搜索引擎自动纠错信息。当搜索引擎对进行了纠正时,返回纠正后的及纠错类型。 |
refinement_chips | object | 搜索筛选建议。 |
item_types | array | 当前搜索结果中的结果类型。该接口通常为 dataset。 |
se_results_count | integer | 搜索结果总数。 |
items_count | integer | items 数组中返回的结果数量。 |
items | array | 搜索结果数组。 |
refinement_chips 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 refinement_chips。 |
xpath | string | 素在页面中的 XPath。 |
items | array | 筛选建议项目。 |
items[].type | string | 素类型,固定为 refinement_chips_element。 |
items[].title | string | 筛选建议标题。 |
items[].url | string | 带筛选参数的搜索 URL。 |
items[].domain | string | 搜索结果中的域名。 |
options | array | 进一步的搜索筛选选项。 |
options[].type | string | 素类型,固定为 refinement_chips_option。 |
options[].title | string | 筛选选项标题。 |
options[].url | string | 带筛选参数的搜索 URL。 |
options[].domain | string | 搜索结果中的域名。 |
items[] 数据集字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 结果类型,固定为 dataset。 |
rank_group | integer | 同类型结果中的组排名。不同类型结果之间的位置不会计该字段。 |
rank_absolute | integer | 在整个搜索结果页面中的绝对排名。 |
position | string | 结果在页面中的对齐位置,可为 left 或 right。 |
xpath | string | 结果的 XPath。 |
dataset_id | string | 数据集 ID。 |
title | string | 搜索结果标题。 |
image_url | string | 数据集图片 URL。该 URL 可能指向原始资源,也可能指向平台存储的图片。 |
scholarly_citations_count | integer | 引用该数据集的学术文章数量。 |
scholarly_articles_url | string | Google Scholar 学术文章列表 URL。 |
unique_identifier | string | 数据集的数字对象唯一标识,例如 DOI URL。 |
related_article | string | 与该数据集的已发表文章 URL。 |
links | array | 搜索结果下方显示的站点链接;没有链接时通常为 null。 |
dataset_providers | array | 提供数据集的机构列表。 |
formats | array | 数据集文件格式列表。 |
authors | array | 数据集列表。 |
licenses | array | 数据集许可证列表。 |
updated_date | string | 数据集最近更新时间,UTC 格式:yyyy-mm-dd hh-mm-ss +00:00。 |
area_covered | array | 数据集覆盖区域,例如 Africa、Global。 |
period_covered | object | 数据集覆盖的时间范围。 |
dataset_description | object | 数据集描述信息。 |
links[] 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 link_element。 |
title | string | 站点链接标题。 |
description | string | 搜索结果描述。 |
url | string | 站点链接 URL。 |
domain | string | 搜索结果中的域名。 |
dataset_providers[] 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 dataset_providers_element。 |
title | string | 数据集提供机构名称。 |
url | string | 提供机构网站 URL。 |
domain | string | 提供机构网站域名。 |
formats[] 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 formats_element。 |
format | string | 文件格式,例如 zip、html、csv。 |
size | string | 文件大小,单位为字节。 |
authors[] 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 authors_element。 |
name | string | 数据集姓名或名称。 |
url | string | 链接 URL。 |
domain | string | 链接域名。 |
licenses[] 字段
| 字段 | 类型 | 说明 |
|---|---|---|
type | string | 素类型,固定为 licenses_element。 |
title | string | 许可证名称。 |
url | string | 许可证 URL。 |
domain | string | 许可证页面域名。 |
period_covered 字段
| 字段 | 类型 | 说明 |
|---|---|---|
start_date | string | 数据覆盖开始时间,UTC 格式。 |
end_date | string | 数据覆盖结束时间,UTC 格式。 |
displayed_date | string | 搜索结果页面展示的时间范围,例如 Jan 1, 2020 - Dec 31, 2022。 |
dataset_description 字段
| 字段 | 类型 | 说明 |
|---|---|---|
text | string | 数据集描述文本。 |
links | array | 描述文本中的链接。 |
links[].type | string | 素类型,固定为 link_element。 |
links[].title | string | 链接锚文本。 |
links[].description | string | 链接对应的搜索结果描述。 |
links[].url | string | 链接 URL。 |
links[].domain | string | 链接域名。 |
错误处理
建议根据顶层 status_code、任务级 status_code 和对应的 status_message 进行异常处理:
status_code = 20000:请求成功。tasks_error > 0:至少有一个任务执行失败。- 任务级错误应结合任务
id记录,便于重试、排查和结果。 - 完整状态码和说明请参考错误码文档。
实用场景
- 发现行业数据集:按检索目标领域的数据资源,帮助 SEO 或团队寻找权威引用材料,提升专题的可信度。
- 筛选可商用数据:结合
usage_rights和is_free筛选可商业使用或数据集,降低数据采购和版权审核成本。 - 监测数据资源更新:使用
last_updated获取近期更新的数据集,支持研究报告、行业资讯和数据型保持时效性。 - 分析数据集搜索竞争:记录数据集结果的排名、提供机构、文件格式和描述信息,评估目标主题在 Google Dataset Search 中的覆盖。
- 构建数据选题库:按
topics、覆盖区域和时间范围整理数据资源,为统计报告、可视化页面和长尾 SEO生成提供选题依据。