北京时间9月3日深夜,美国所有头部AI服务集体出现故障,ChatGPT、Claude、Grok宣布服务出现异常,谷歌Gemini、微软Copilot也收到大量中断报告。此次大规模“宕机”事件持续约3小时40分。

DownDetector网站也显示,报告Gemini、Copilot出现服务中断的数量也明显上升。

AI编程工具Cursor也表示,其部分服务因Claude、ChatGPT和Grok故障受影响。

据Downdetector数据,已有超过12000份用户报告指出OpenAI存在问题。关于Claude的问题报告约有1200份。关于Grok的问题报告约有1000份。

大规模“宕机”事件持续约3小时40分,截至北京时间9月4日凌晨1点10分,所有服务已经恢复。

据Anthropic的技术部门员工CJ Avilla在社交媒体透露,此次事件由“基础设施问题”引发。

有分析指出,此次事件可能与关键互联网底层设施Cloudflare出现问题有关。简单来说,用户访问某个网站时,请求可能并不是直接打到网站自己的机房,而是先进入Cloudflare。Cloudflare会判断你是不是正常用户、有没有攻击风险,然后从附近节点把页面内容返回给用户。

Cloudflare状态页面显示,今天这项服务出现了两个问题:

1、影响R2自定义域名的HTTP/3问题:部分使用自定义域名连Cloudflare R2存储的网站或应用,在通过HTTP/3发起请求时可能出现失败或性能下降;

2、部分WARP用户地理位置识别错误:一些Cloudflare WARP用户可能会被识别为从错误的地理位置连接。

另有消息指出,底层原因可能与微软Azure有关,该平台同样出现了故障报告激增的情况。Anthropic、xAI与OpenAI均依赖Azure提供云计算服务,不过它们的算力架构中也包含了谷歌等其他服务商。

从历史上看,此次事故为持续时间最长、影响范围最广的AI大模型集体宕机事件。而针对该起事件,不论是产业界还是资本圈,都会审视其问题源头,对智能体接管社会运作的安全伦理和解决方案进行长期的讨论。

在AI巨头集体宕机之际,OpenAI正式发布GPT-6 Astra,并称其为“目前全球最智能、且对齐程度最高的模型”,在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作方面均达到当前最先进水平,并使用超过10万块GPU在得州Stargate基地完成训练。

OpenAI总裁格雷格·布洛克曼表示,人们未来或许会回头将“这个时间、这个模型”视为人工通用智能(AGI)到来的节点,并在发布会最后称:“欢迎进入AGI时代。”

OpenAI称,Astra能够直接完成一系列过去需要人工操作的软件任务,包括填写在线表格、更新CRM客户记录、整理日历、开展在线研究并生成摘要,还能分析科学数据、制作图表、创建网站并执行前端QA检查,甚至可以自主安装和测试软件、根据屏幕反馈排查故障。

与此同时,Astra也是OpenAI首个达到内部“关键”(Critical)网络安全能力门槛的模型,意味着它已经具备发现此前未知漏洞、开发漏洞利用程序的能力。出于安全考虑,OpenAI对其最先进的网络安全能力设置了更严格的访问限制。

(羊城晚报•羊城派综合自证券时报、21世纪经济报道)

责编: 校对: 审签:
版权申明

羊城晚报·羊城派原创,未经授权不得转载