
Qzone
微博
微信
极客网·人工智能8月17日 北京时间今日凌晨,人工智能公司Anthropic旗下AI平台Claude发生一次影响广泛的服务中断事件。经初步调查,本次故障的直接技术原因锁定为公司主要认证网关数据库遭遇“急性流量失衡”,导致登录服务连锁崩溃。目前,所有受影响服务已恢复正常运行。
根据Anthropic官方状态页面披露的信息,故障始于北京时间8月17日5时58分(UTC时间8月16日21时58分)。监控系统在第一时间捕捉到错误率急剧攀升,随后用户陆续报告无法登录Claude.ai网页端、Claude Code开发工具以及Claude Cowork协作平台。整个中断过程持续约35至42分钟。值得关注的是,面向开发者的Claude API 和 Claude Console 服务在整个事件中始终保持正常运行,未受影响。
Anthropic 工程团队在初步事故分析中解释,本次故障的罪魁祸首是公司主要认证网关数据库出现了严重的流量分布不均(acute traffic imbalance)。这一失衡引发一连串连锁反应:
· 队列积压。认证请求在数据库中大量堆积,形成“队列反压”(queue backpressure),新请求无法及时处理;
· 服务器过载丢弃连接。持续的压力导致应用服务器资源耗尽,开始提前丢弃连接请求,进一步加剧错误;
· 用户端报错。最终表现为用户浏览器或客户端收到间歇性HTTP 500内部服务器错误及网关超时提示,页面无法加载或登录失败。
简而言之,作为“门卫”的认证系统在某一刻突然承受了远超设计容量的请求压力,导致系统内部“堵车”并最终瘫痪。而无需登录鉴权的API接口由于绕过了这一网关,因此得以幸免。
为快速恢复服务,Anthropic工程师采取了两步紧急操作:一是重新路由入站请求:将流向故障网关的API请求切换至冗余的网关集群,分流压力;二是重分配内存资源:调整用于管理提示词状态(prompt state management)的内存池配置,释放系统资源。
这些措施实施后,系统遥测数据在6时42分显示流量和错误率全面回归正常区间,所有面向用户的服务陆续恢复可用。
截至发稿,Claude所有服务均已完全恢复,未报告数据丢失或安全泄露事件。Anthropic方面表示,将在后续发布正式的事后分析报告(post-mortem),详述为防止此类数据库瓶颈再度发生而拟定的长期架构改进方案,包括但不限于认证网关的弹性扩容策略、流量预警机制优化以及队列治理升级。
对于此次故障给全球用户带来的不便,Anthropic在状态页面中致歉,并强调将以此为契机提升系统韧性,确保AI服务的稳定可靠。
【以上内容转自“极客网”,不代表本网站观点。如需转载请取得极客网许可,如有侵权请联系删除。】