通过官方 MediaWiki API 按标题、URL 或 Wikidata ID 提取维基百科文章。返回文章标题、摘要(首段)、纯文本全文、缩略图、首图、所有类目、地理坐标(适用时)、Wikidata Q-ID、过去 30 天页面浏览量,以及其他语言的引用。支持 12+ 语言,包括英语、德语、法语、西班牙语、中文和日语。适用于 AI 训练数据、知识图谱富化、RAG 数据摄入和参考数据库。
# 通过 Apify API 启动运行 curl -X POST "https://api.apify.com/v2/acts/santamaria-automations~wikipedia-scraper/runs?token=YOUR_TOKEN" \ -H "Content-Type: application/json" \ -d '{ "queries": [ "Stripe (公司)", "OpenAI", "埃菲尔铁塔", "阿尔伯特·爱因斯坦", "Transformer (机器学习模型)" ], "language": "zh", "extractFullContent": true, "includePageviews": true }' # 或通过 MCP 与 AI 代理配合使用: # https://mcp.apify.com?tools=santamaria-automations/wikipedia-scraper
| 字段 | 类型 | 示例 |
|---|---|---|
| title | string | 埃菲尔铁塔 |
| page_id | integer | 9202 |
| wikidata_id | string | Q243 |
| summary | string | 埃菲尔铁塔是一座位于法国巴黎的镂空结构铁塔... |
| content | string | 埃菲尔铁塔(法语:La Tour Eiffel)... |
| thumbnail_url | string | https://upload.wikimedia.org/wikipedia/commons/... |
| categories | array | ["埃菲尔铁塔","巴黎建筑"] |
| coordinates | object | {"lat":48.8584,"lon":2.2945} |
| pageviews_30d | integer | 512,847 |
| canonical_url | string | https://zh.wikipedia.org/wiki/埃菲尔铁塔 |
点击上方 在 Apify 上打开,在浏览器中运行 wikipedia-scraper — 无需代码,无需安装。在 Apify 控制台,您可以获得:
要从自己的代码运行此 actor,您需要一个 Apify API 令牌。大约一分钟完成:
免费额度:Apify 每月为您的账户提供 5 美元平台使用额度,无需信用卡。足以有意义地测试任何 actor — 按典型 scraper 每条结果 0.001 美元计算,每月大约 5,000 条免费结果。
通过 Apify REST API 从任何语言运行此 actor。将 YOUR_TOKEN 替换为您的 API 令牌,并根据需要调整输入 JSON。
curl -X POST "https://api.apify.com/v2/acts/santamaria-automations~wikipedia-scraper/run-sync-get-dataset-items?token=YOUR_TOKEN" \
-H "Content-Type: application/json" \
-d '{}'// npm install apify-client
import { ApifyClient } from 'apify-client';
const client = new ApifyClient({ token: 'YOUR_TOKEN' });
const run = await client.actor('santamaria-automations/wikipedia-scraper').call({});
const { items } = await client.dataset(run.defaultDatasetId).listItems();
console.log(items);# pip install apify-client
from apify_client import ApifyClient
client = ApifyClient('YOUR_TOKEN')
run = client.actor('santamaria-automations/wikipedia-scraper').call(run_input={})
items = list(client.dataset(run['defaultDatasetId']).iterate_items())
print(items)// dotnet add package Apify.Client
using Apify.Client;
var client = new ApifyClient("YOUR_TOKEN");
var run = await client.Actor("santamaria-automations/wikipedia-scraper").CallAsync(new { });
var items = await client.Dataset(run.DefaultDatasetId).ListItemsAsync();// Maven: com.apify:apify-client
import com.apify.client.ApifyClient;
ApifyClient client = new ApifyClient("YOUR_TOKEN");
ActorRun run = client.actor("santamaria-automations/wikipedia-scraper").call(Map.of());
List<Map<String,Object>> items = client.dataset(run.getDefaultDatasetId()).listItems();此 actor 可在 Apify MCP 服务器上使用,因此您可以从任何兼容 MCP 的 AI 客户端驱动它 — Claude Desktop、Claude.ai、Cursor、VS Code、LangChain、LlamaIndex 或自定义 agent — 无需编写代码。
https://mcp.apify.com?tools=santamaria-automations/wikipedia-scraper连接后的示例提示:
"使用 wikipedia-scraper 运行一次 scrape,并将结果以表格形式返回给我。"
支持动态工具发现的客户端(Claude.ai、VS Code)会通过 add-actor 自动接收完整的输入 schema。
从您喜欢的自动化工具触发此 actor。下面的每个平台都可以点几下就调用 Apify API — 无需代码。
@apify/n8n-nodes-apify)。santamaria-automations/wikipedia-scraper。https://api.apify.com/v2/acts/santamaria-automations~wikipedia-scraper/run-sync-get-dataset-items?token=YOUR_TOKEN。application/json。https://api.apify.com/v2/acts/santamaria-automations~wikipedia-scraper/run-sync-get-dataset-items?token=YOUR_TOKEN,方法 POST,body raw JSON。https://api.apify.com/v2/acts/santamaria-automations~wikipedia-scraper/run-sync-get-dataset-items?token=YOUR_TOKEN。steps.http.$return_value。https://api.apify.com/v2/acts/santamaria-automations~wikipedia-scraper/run-sync-get-dataset-items?token=YOUR_TOKEN,body 类型 JSON。