[控场AI]
产品Common Crawl数据库

Common Crawl

持续爬取互联网内容的公共数据库,自2008年起运行,已积累超过250亿个网页的原始抓取内容,是全球最大的公开网络语料库之一

核心事实

时间轴 (近 90 天)

8月24日

OpenBMB发布了面向LLM预训练的开放英文网页语料库UltraFineWeb,总量超过1万亿token、约11.4亿篇文档,全部来自Common Crawl并以Apache 2.0许可证开放

待验证50%
8月22日

Common Crawl数据集包含了大量Reddit页面,是多数大模型训练的基础语料之一

待验证50%
8月4日

Common Crawl是一个非营利组织,自2008年起持续抓取互联网内容并免费开放数据集

已验证65%
8月4日

CCBot is the crawler for the Common Crawl project

待验证100%

全部知识事实 (4)

来源文章