Meta测试数据中心机器人:插拔线缆、重启服务器以压低AI人力成本

Meta 正在数据中心测试机器人执行插拔线缆和重启服务器等任务,多位现任及前员工透露,该项目仍在进行中,涉及 Watney Robotics、Kinova 和 ABB 的硬件,目标是在 AI 基础设施投入飙升时控制劳动力成本。

Meta正把机器人直接送进数据中心,让它们动手处理服务器机柜里的线缆和电源按钮。这不是科幻演示,而是已经进入实验阶段的真实项目。多位现任和前员工向Wired透露,机器人目前能完成插接线缆、重启服务器以及其他常规运维操作。整个工作此前从未被公开报道,显示Meta在AI算力狂飙的背景下,正悄悄寻找降低人力开支的路径。

这一测试直接指向AI时代数据中心的痛点。训练和推理大模型需要海量GPU集群,数据中心规模快速扩张,传统靠人巡检、插线、复位的模式越来越难以为继。Meta的选择是让机器人先接手最重复、最容易标准化的那部分工作,从而把人力释放到更需要判断和应急的环节。知情人士强调,项目仍在持续推进,但尚未进入大规模部署阶段。

Meta 机器人已在实验中承担线缆插拔和服务器重启

根据了解项目的员工描述,Meta当前测试的核心任务集中在两个高频运维场景:插拔线缆和重启服务器。数据中心里每天都有网线、光纤因为维护、扩容或故障需要重新连接,人工操作不仅耗时,还容易出现接触不良或插错端口的问题。机器人通过精确的机械臂和视觉系统,可以重复完成这些动作,减少人为失误。

重启服务器则是另一个典型场景。集群中偶尔会出现单机死机、软件卡死或需要强制重置的情况,传统做法是运维工程师现场或远程操作电源按钮。Meta的测试机器人已经能在机柜间移动,定位目标服务器,完成物理重启动作。这类任务重复性高、危险性低,特别适合机器人替代。

实验目前仍在小范围进行。员工透露,Meta没有把全部希望寄托在单一机器人平台上,而是同步测试多家厂商的设备,观察它们在真实数据中心环境下的可靠性和兼容性。整个过程强调实用性:机器人不需要会写代码或诊断复杂故障,只需要稳定地执行插、拔、按这几个基础动作。

这一进展意味着数据中心运维正在从“人盯机”转向“机助人”。过去运维团队必须24小时待命处理物理层问题,现在机器人可以先接手夜间或非高峰期的常规操作,降低人力疲劳和出错概率。不过,目前还不清楚这些机器人能否处理更复杂的线缆缠绕或高温环境下的操作。

Watney、Kinova、ABB 三家厂商硬件同时进入测试

Meta并未局限于单一供应商,而是同时引入了Watney Robotics、Kinova和ABB的机器人及相关硬件。这一多供应商策略反映出Meta希望通过对比找到最适合数据中心环境的解决方案,也显示当前没有一家厂商能单独满足全部需求。

Watney Robotics专注于数据中心场景的专用机器人,其设计可能更贴合机柜密集、走线复杂的环境。Kinova以协作机械臂闻名,提供高精度、灵活度较高的臂端执行器,适合精细的线缆插拔动作。ABB则是工业机器人领域的巨头,其设备在可靠性、负载能力和长时间连续运行方面有优势。

知情人士表示,Meta正在评估不同硬件在同一实验中的表现,包括定位精度、故障率、与现有数据中心管理系统对接的难度等。这种并行测试的方式能帮助Meta快速迭代需求,同时也给供应商施加了压力——只有真正能在高温、电磁干扰严重的机房里稳定工作的产品才能胜出。

目前三家厂商对Meta项目的公开态度不一。Kinova和ABB均拒绝就此事置评,Watney Robotics则没有回应采访请求。这也从侧面说明项目仍处于高度保密阶段,Meta不愿在技术尚未成熟时引发过多外界讨论。

机器人运维直接服务于 AI 数据中心规模扩张

Meta推动这项机器人测试的根本动机,是应对AI基础设施投入的爆炸式增长。训练新一代大模型需要成千上万张GPU,数据中心必须持续扩建机柜、增加电力和冷却容量。与此同时,人力成本却在同步上升——招聘、培训和保留有经验的数据中心运维工程师变得越来越昂贵。

通过引入机器人,Meta希望实现“以更少人力运营不断扩张的数据中心”。机器人可以一天24小时工作,不需要休息、倒班或假期,能大幅降低人力投入比例。特别是在AI算力需求呈现指数级增长的阶段,这种成本控制显得尤为关键。

员工透露,这一项目正是Meta在AI竞赛中保持竞争力的配套措施。OpenAI、Google、Microsoft等对手都在疯狂扩建数据中心,谁能把每瓦算力的总体拥有成本(TCO)压得更低,谁就拥有长期优势。机器人运维正是降低TCO的重要一环,它把原本依赖人工的物理层操作变成可规模化、可预测的自动化流程。

当然,机器人本身也需要投资,包括采购、维护、编程和与现有基础设施集成。但从长远看,一旦实现稳定运行,其边际成本会远低于持续增加的人力开支。这正是Meta当前押注的方向。

传统人工运维在重复性任务上将被逐步替代

数据中心传统运维高度依赖人工。工程师需要穿戴防静电服,在机柜间穿梭,弯腰插拔线缆,记录每一次操作。夜班、节假日值守、突发故障紧急响应,都是这份工作的常态。这些重复性高、标准化程度高的任务,正是机器人最容易切入的领域。

Meta测试的插拔线缆和重启服务器,正是人工运维中占比很大的两类工作。机器人能以固定节奏、固定力度完成操作,避免人为疲劳导致的接触不良或误操作。长期来看,这类任务的人工需求会逐步下降,运维团队的角色将转向监督机器人、处理例外情况和优化系统。

这种替代并非一夜之间完成。机器人目前还无法处理所有边缘场景,比如线缆严重缠绕、标签缺失、硬件故障诊断等。但在可预测的常规维护上,机器人已经展现出优势。Meta的实验正是要量化这种优势:一台机器人一天能完成多少次插拔操作,故障率是多少,与人工相比节省多少时间。

对整个行业而言,这标志着运维模式从“人为主、机为辅”向“机为主、人为辅”的转变。类似变化已经在汽车制造、物流仓库发生,现在开始进入数据中心。那些重复、枯燥、易出错的体力劳动,将率先被机器人接手。

国内云厂商或面临同类自动化成本压力

Meta的机器人测试对中国云服务商构成直接参照。阿里云、腾讯云、华为云、百度智能云等国内厂商同样在大力扩张AI算力集群,数据中心规模快速增长,人力成本压力同样存在。Meta通过机器人控制劳动力成本的做法,值得国内厂商认真研究。

国内数据中心运维同样面临高频插拔、服务器重启、巡检等重复工作。在人力成本逐年上升、工程师招聘难度加大的背景下,引入机器人自动化运维能有效降低边际成本。尤其是随着国产机器人厂商的崛起,硬件供应链比Meta当年更具优势,落地成本可能更低。

但国内厂商也面临独特挑战:数据中心标准化程度、机柜布局统一性、与现有监控系统的集成难度,都会影响机器人落地效果。Meta的多厂商并行测试策略,对国内云厂商同样适用——不应把希望寄托在单一供应商,而应通过实际实验验证不同机器人在真实机房环境下的表现。

更重要的是思维转变。过去国内云厂商更依赖人力密集型运维模式,未来必须把自动化、机器人化提升到战略高度。只有尽早启动类似测试,才能在AI基础设施竞争中保持成本竞争力。Meta的做法表明,控制人力成本不再是可选项,而是AI时代数据中心必须解决的必答题。

项目仍处内部测试阶段,规模化时间表未明

尽管Meta已在推进机器人测试,但整个项目仍处于早期阶段。目前仅有多位匿名员工透露相关信息,官方尚未发布任何正式声明。Wired的报道是外界首次了解到这一工作的细节,这也说明Meta有意保持低调。

项目“仍在进行中”的表述,意味着距离真正的大规模部署还有相当距离。机器人需要在各种真实故障场景、不同机型服务器、复杂走线环境下反复验证可靠性。数据中心对稳定性的要求极高,一次误操作可能导致重要业务中断,因此Meta不可能贸然扩大规模。

三家厂商的沉默进一步增加了不确定性。Kinova和ABB拒绝置评,Watney没有回应,显示各方都在等待Meta给出更明确的信号。未来Meta是否会公开技术细节、是否会与供应商共同发布白皮书,目前都还不清楚。

对行业观察者而言,这意味着需要保持耐心。机器人运维虽然方向明确,但真正实现“少人化”运营可能还需要几年时间。Meta的测试最终能否成功,将直接影响全球数据中心运维的演进节奏。在此之前,人工与机器人混合运维仍将是主流模式。

参考来源