Reed's News
← 返回精选

The Numbers网站消失的背后

Tech 78 nickthegreek 2026/7/23 2754 字 原文 ↗

权威电影数据网站一夜消失的真相:你依赖的每个网站,都比想象中脆弱

如果你从事电影行业或相关工作,很可能在本月不知不觉间用过 The Numbers 的数据。

这家网站的数据全靠人工调研,质量堪称业内顶尖,追踪着7.8万多部影片、23.6万多位从业者的票房收入、制作预算、家庭录像及流媒体表现。它每年的访问量超 800万人次,被记者、学者、电影人、预测市场 甚至 吉尼斯世界纪录 奉为权威标杆。

也正是这份"行业天花板"的地位,酿成了今年3月那场灾难性事件。

2026年3月5日,TheNumbers.com 突然从网络上消失了。

网站 瘫痪超过一周,没有任何解释。一周后它重新上线,规模却只剩原来的零头:历史图表、单部影片详情页,甚至深受用户喜爱的报表生成器都不见了。

面对一句笼统的"我们正在重建,请耐心等待",网友们的反应不出意料——困惑、愤怒,各种阴谋论随之而来。

Reddit上甚至有传言称,这是一场刻意的"跑路式关停",目的是搞垮免费网站,倒逼用户转向付费产品。

三个月后,我与The Numbers创始人兼CEO布鲁斯·纳什(Bruce Nash)长谈,了解到事件的全貌。他形容那是一段糟心又波折的经历:

"我们收到了大量愤怒的邮件,人们质问:'以前有的页面怎么没了?'"

他的讲述里,藏着所有运营、依赖或热爱互联网的人都该警惕的问题。

先从背景说起

1997年10月17日,数学家、前IBM软件工程师布鲁斯·纳什 在Geocities平台上线了一个网站,当时仅追踪300部影片。

布鲁斯在一篇 20周年纪念文章(如今仅存于互联网档案馆,原因后文会揭晓)中这样描述网站诞生:

"我在Access数据库里点了个按钮,把一些HTML页面上传到Geocities,然后在好莱坞证券交易所(HSX)的留言板上发了条简短通知,告诉大家我开始分析电影票房,帮他们挑选交易用的'电影股票'。"

从如此简陋的起点,布鲁斯和他组建的团队一步步将The Numbers打造成电影行业最可靠的财务数据来源。

截至2026年初,网站数据库已收录78396部影片、178375条院线发行记录、236176位从业者信息。

机器人来了

运营三十年来,The Numbers面临的挑战发生了翻天覆地的变化。成立后的头25年左右,网站流量可控,访客大多守规矩。布鲁斯说:

"AI时代到来前,我们的访客主要是人类、守规矩的搜索引擎爬虫,还有少数为个人项目爬取数据的人。如果有人太贪心,我们能发现并拉黑他们。"

过去几年,全球网站管理者都发现流量构成变了:原本以人类浏览为主,如今机器人占比越来越高。到2024年,自动化流量已超过人类流量;就在上个月,Cloudflare宣布,机器人流量占网页请求总量的57.5%

The Numbers经历了两轮明显的冲击。第一轮始于2024年:

"随着AI训练爬虫加入搜索引擎爬虫的行列,我们的爬取量大幅增加。AI爬虫通常比搜索引擎爬虫更不守规矩,这让我们要花更多精力维持网站平稳运行。"

第二轮冲击更猛烈、破坏性也更强:

"2025年12月左右,我们发现流量又一次暴涨,我认为这要归因于'智能体AI'——既有响应指令爬取网站的AI智能体,也有人借助工具编写爬取脚本。"

和所有数据密集型网站一样,到2026年初,The Numbers已被AI机器人以工业化规模反复爬取,不堪重负。布鲁斯表示,网站仅10%的流量来自人类访客,其余全是AI机器人和自动化流量。

网站尝试适应新的机器人

这给网站带来了巨大压力,但布鲁斯和团队还是采取了一些措施缓解冲击。其中最巧妙的一招,是用机器人的"语言"和它们沟通:

"我们在网站上设置了供大语言模型(LLM)读取的内容,引导它们告知用户'如何获取数据授权',而非'如何爬取网站'。这一招效果显著,现在我们收到的授权咨询量大概是之前的十倍。"

但缓解不等于解决。从2025年12月到2026年3月初,团队一直在全力维持旧网站运转。布鲁斯估算:

"我们90%的时间都花在维持现有网站运行上,只能利用零碎时间开发新的改进版系统。"

雪上加霜的是网站的"年龄":已有30年历史,约16万个源文件支撑着200万左右的页面。

然后,在3月5日周四凌晨,服务器崩溃了。

团队紧急排查原因,最初以为是AI流量过大所致。AI确实难辞其咎,但可能不止是流量过载那么简单。

在海量智能体AI流量中,网站日志显示了比单纯爬取更棘手的行为。布鲁斯描述道:

"有些机器人用合法URL访问网站,另一些则在寻找后门,很可能是为了抢先获取尚未公开的数据,或是篡改展示给用户的信息。"

在一位 cybersecurity(网络安全)从业者朋友的建议下,旧服务器彻底关停了。恢复备份、让这个30年的老网站重新上线,意味着要为16万个遗留文件设防,而攻击者已经花了几个月时间探查漏洞。

团队紧急在新服务器上搭建了一个极简版网站,至少能提供最新票房数据,同时复盘事件、规划下一步。这个极简版于3月13日周五上线。

谁会想非法访问一个票房数据网站?

乍看之下,The Numbers似乎不是理想的攻击目标:它不收集信用卡信息,也没有能在暗网牟利的用户数据,只是一家发布电影票房的小型独立公司。

仅仅非法访问它,怎么赚钱?

答案或许你已经猜到了——和预测市场有关。

Polymarket 每周都会针对影片首映周末开设预测市场,明确将The Numbers列为 最终数据来源

"影片首映3天周末的最终票房数据,将以The Numbers网站'票房'板块下的'每日票房表现'为准,用于结算该市场交易。"

单周末的预测市场规模按金融市场标准来看不算大,通常在几十万到上百万美元之间,所有活跃票房预测市场的总规模约为几百万美元

但如果你能每周都比其他人提前看到The Numbers的数据,就能获得巨大交易优势——提前知晓结果,就能抢先交易牟利。

目前我们无法确定具体发生了什么:日志显示网站被自动化工具持续探查、爬取了数月,但最终导致网站崩溃的原因和攻击者身份仍无定论。

不过,有人利用AI在预测市场牟利的说法完全站得住脚。The Numbers的遭遇揭示了三个事实:

  • 如今,一个电影数据网站都值得被攻击,因为预测市场让任何人都能把几乎所有数据变现
  • 如今任何人都能发起网站攻击,只需订阅廉价AI工具即可。
  • 面对大规模智能体AI机器人,我们熟悉的互联网极其脆弱

现在攻击网站有多容易?

2025年11月,Claude背后的AI公司Anthropic发布报告,记录了 首例有案可查的AI协同网络间谍活动。一个受国家资助的组织利用其AI编程工具攻击了约30家机构,AI完成了80%-90%的工作,人类仅在每个攻击流程中参与4到6个决策节点。

Anthropic的结论是: "发起复杂网络攻击的门槛已大幅降低,而且我们预计门槛还会继续下降。"

在更早的一份 威胁报告 中,Anthropic的表述更直白: "缺乏技术能力的罪犯正利用AI实施复杂操作,比如开发勒索软件——这类操作过去需要多年训练才能完成。"

与此同时,一款名为XBOW的自主AI渗透测试工具登上了HackerOne美国排行榜榜首,该榜单原本只有人类参与者,他们靠发现企业安全漏洞赚取赏金;XBOW提交了近1060个漏洞。

攻击一个有30年历史、包含16万个遗留文件的网站,正是AI工具擅长的"低成本探查已知漏洞"场景。曾经保护小型网站、阻挡绝大多数攻击者的技术门槛,如今已基本消失。

The Numbers的未来?

布鲁斯和团队还算幸运。尽管网站一夜之间彻底瘫痪,但他们挺了过来。The Numbers一直免费开放,且近几年不太依赖广告收入,所以这次停运并未摧毁他们的核心营收渠道。

他们的核心业务是通过OpusData服务批量售卖数据、为电影人和投资者制作竞品分析报告,以及发布 行业商业报告——这些业务都未受公共网站停运的影响。

但他们需要从零开始搭建一个全新网站,承载78396部影片、178375条发行记录和236176位从业者的数据。恢复旧网站备份根本行不通,布鲁斯解释道: "我们很清楚不能再重启旧服务器,否则它肯定会再次崩溃,甚至可能在几分钟内就被打垮。"

这就是为什么3月中旬重新上线的网站如此简陋,且功能只能逐步恢复,无法一次性全部回归。

目前,团队不得不重新思考:2026年的公共网站到底意味着什么?布鲁斯分析,The Numbers过去服务两类受众(人类和搜索引擎),如今要服务约六类:人类、搜索引擎、大语言模型训练爬虫、指令触发式AI流量、智能体AI,以及预测市场交易者。每一类受众都有不同需求和流量特征。他说: "以前运营网站只需关注三件事:内容、广告、SEO(搜索引擎优化),现在每个设计决策都要考虑八到十个因素。"

他表示,目标是兼顾这六类受众,为OpusData用户和商业报告订阅者提供新服务与在线功能,更重要的是帮助普通人类用户找回网站曾提供的所有数据,其中一部分会以优化后的新形式呈现。

机器人爬取的危害到底有多大?

相当大,毫不夸张。大到像布鲁斯这样的网站管理者,都要质疑投入大量时间和金钱搭建、维护网站是否值得。

Cloudflare 为全球大量网站提供防护,它发布的数据显示了各AI平台的"爬取-引流比":每给网站带来一位访客,AI平台会爬取多少页面。

谷歌每带来一位访客,会爬取约5个页面;OpenAI超过1000个;Anthropic则超过3.8万个。

注:图表采用对数刻度,即横轴每一格代表的数值是前一格的十倍,否则数值差距过大,无法在一张图中呈现。

互联网发展至今,开放网络的核心逻辑是:允许搜索引擎爬虫读取网站内容,以此换取爬虫带来访客。但如今,这笔"交易"已不复存在。机器人数量暴增,却不再给网站带来访客。

当这种流量洪流涌向小型网站,不仅会推高带宽成本,甚至可能直接导致网站崩溃。有类似遭遇的网站包括:

  • Read the Docs:一家托管开源软件文档的非营利组织,曾在一个月内被单个爬虫下载了73TB的压缩HTML文件,仅带宽成本就超5000美元。
  • iFixit:维修指南数据库,曾在一天内记录到Anthropic爬虫的100万次访问。
  • Triplegangers:一家7人规模的3D扫描公司,曾被OpenAI的机器人在工作时间击垮,其CEO称之为"本质上是DDoS攻击"。代码托管服务SourceHut的创始人称,每周要花20%-100%的时间 应对AI爬虫,网站"每周会断网几十次"。
  • Linux新闻网站LWN的编辑提到,爬虫流量来自 "数百万个IP地址",并得出结论:"这就是分布式拒绝服务攻击。"
  • 开源项目GNOME统计流量时发现,约97%是机器人流量
  • 一所大学图书馆为维持馆藏系统运行,48小时内封禁了1.6万个IP地址

运营维基百科的维基媒体基金会在2025年4月 报告 称,机器人流量占页面浏览量的35%,但占高成本流量的比例至少为65%——因为爬虫会批量读取人类极少访问的冷门页面。

半年后,情况雪上加霜:维基百科的 人类页面浏览量同比下降约8%,因为人们越来越多地从AI摘要获取维基百科的知识,根本不会访问网站。机器正以工业化规模同时夺走内容和访客。

在现实世界中"公测"AI

AI工具是人类创造的最强大、也最具破坏性的技术之一,而我们正让公众在现实世界中实时"公测"这些工具。当年曼哈顿计划测试原子弹威力时,可不会每天把技术规格发给所有人,看哪些房子会被炸掉。

我们目前构建的世界,完全没有准备好应对人人可及的AI模型的力量和规模。

我不想把这说成片面的反AI恐慌。AI有很多可取之处,能为人类带来巨大价值。但我们必须认真审视当下正在步入的世界。

最先崩溃的,是为旧互联网设计的产物。开放网络建立在一系列假设之上:访客大多是人类,流量与读者数量大致匹配,运营网站的成本与获得的价值成正比。如今,这些假设全都过时了。

一年前,Cloudflare推出了 按爬取量付费 模式,允许网站向AI爬虫按页面收费。上周,它更进一步,宣布推出按使用量付费模式:当网站内容出现在AI回答中时,发布者可获得报酬;同时宣布从9月15日起,其客户的广告支持页面将默认拦截未付费的"混合用途"爬虫。

这些措施能否奏效,取决于AI公司是否配合,而非想方设法绕开规则。但正如布鲁斯所说,总得有人尝试。

尾声

跳出具体事件本身,我们来看看这件事的本质:

一个深受喜爱、实用免费的网站,由一位靠谱、正直的人精心运营了近30年,最终被新AI经济的两大因素压垮:

一方面是难以为继的机器流量,另一方面很可能是受利益驱动的入侵者——在如今攻击网站前所未有的容易的环境下,他们发起了攻击。

布鲁斯的业务和生计得以保全,只是因为网站并非其全部业务。

其他人就没这么幸运了。就在上周,有37年历史的德国纺织公司ZEGO在3月遭遇一次网络攻击后,生产停滞六周,最终 申请破产。与The Numbers不同,他们没有其他业务可以依靠。

互联网上遍布着独立档案库、爱好者数据库、地方新闻网站、论坛和参考资料。这些凝聚了人类数十年心血的成果,运行在陈旧代码之上,由小团队甚至个人维护,默默支撑着我们共享知识的根基,其重要性远超人们的认知。

The Numbers正在重建,未来会比之前更稳固。我建议大家继续使用、支持它;如果你曾因页面消失给布鲁斯发过愤怒的邮件,现在了解真相后,不妨发一封友善的邮件表达理解。