应用场景

LLM 训练语料采集

构建搜索引擎与 LLM 数据集。

跨数十万 IP 的并发抓取,内置智能重试与友好抓取策略,为基础模型训练、搜索索引和向量数据集提供大规模数据支撑。

  • 无限并发会话
  • 地域均衡采集
  • 支持 robots.txt 规则
联系技术顾问
关键数据
1.2B+
每周抓取页面数
推荐产品
IPv6 代理
$0.50/天起 · 10 Mbps 至 1 Gbps · 不限流量

IPv6 不限量固定收费方案,对于全网级抓取这类 TB 级工作负载来说性价比无可匹敌。

了解 IPv6
概览

为什么团队都用 Rainproxy 做LLM 训练语料采集。

大模型训练数据采集代理要解决的是同一个难题:无论是训练基础模型、微调垂直领域 LLM,还是构建 RAG 语料库,都需要在不被限速或封禁的情况下,采集干净、多样、海量的网络数据。Rainproxy 是当今多个最大规模开放网络抓取项目背后的代理层,拥有数十万级并发会话和专为抓取场景打造的完整 IPv6 子网。

与按 GB 计费、规模越大成本越高的住宅方案不同,我们的 IPv6 产品按月固定收费,抓取十亿页面和一亿页面的成本一样。智能重试、自动退避与 robots.txt 识别均已内置,工程团队可以专注在解析器与数据结构上,而不用整天盯着被封的问题。

为什么选 Rainproxy

面向生产级LLM 训练语料采集负载而打造。

TB 级规模下的 IPv6 固定收费

在独享的 IPv6 /48 子网上提供不限量带宽,是抓取开放网络唯一可持续的经济模式。

地域均衡采集

轮询覆盖 12 个区域,保证数据集多样性,避免训练数据出现区域性内容偏差。

面向抓取场景的智能重试

内置指数退避、按主机的友好并发上限,以及 robots.txt 支持。

兼容各类爬虫工具

支持 Scrapy、Apache Nutch、Colly、Crawlee、Common Crawl 工具链以及自研的 Python/Go 爬虫。

使用流程

三步即可上线。

Step 1

提交你的抓取队列

把 URL 推送进你的爬虫程序,IP 池、会话与轮换全部由我们负责。

Step 2

随意并行扩展

在 IPv6 子网上运行数千个并发会话,无需按 GB 付费。

Step 3

自动均衡地域分布

地域均衡采集确保你的语料库不会偏向单一地区。

兼容你的技术栈

直接接入你已经在用的工具。

ScrapyApache NutchCommon Crawl toolingCustom Python crawlersCollyCrawlee
常见问题

常见问题解答。

采集 LLM 训练数据最适合用哪种代理?+

对于纯粹的大规模开放网络抓取,IPv6 是最具性价比的选择:按月固定收费,不计量带宽,而且大多数现代网站都支持 IPv6。若目标站点需要住宅信任度,可在相应链路上混用住宅代理。

抓取数十亿页面会不会导致带宽成本失控?+

不会。Rainproxy 的 IPv6 产品按月固定收费且带宽不限量,这也是基础模型团队用它来做全网抓取的原因。

你们的网络是否遵守 robots.txt?+

我们的默认配置会遵循 robots.txt 并按主机做友好并发限制,但最终选择权在你的爬虫程序中。我们也提供大规模合规采集的最佳实践文档。

大模型训练数据采集代理怎么计费?+

IPv6 线路按月固定收费、带宽不限量,不按 GB 计价,因此抓取十亿页面和一亿页面成本一致,是全网级训练语料采集最省钱的方式。

本周就把LLM 训练语料采集跑起来。

联系销售