AWS 的存储分层策略 - S3 的 8 种存储类别与 Intelligent-Tiering 的自动优化

将 AWS S3 的存储类别群和 Intelligent-Tiering 自动优化与 Azure Blob Storage 和 GCS 的存储层进行比较,解析层级的划分方式、自动化的设计差异以及选用指南。

存储成本优化的本质

云存储成本随数据量增长线性增加。企业持有的大部分数据是访问频率低的「冷数据」,将所有数据持续保存在高性能存储类别中是成本浪费。存储分层是根据数据访问频率将其放置在最优存储类别中,平衡性能与成本的策略。AWS 的 S3 为这种分层准备了从通用到深度归档、用途各有侧重的存储类别群,可以按检索所需时间(毫秒 / 数分钟 / 数小时)与存储单价的组合分级选用。此外,Intelligent-Tiering 的自动优化大幅减轻了人工管理层级的负担。

S3 的 8 种存储类别

(截至 2026 年 8 月,美国东部(弗吉尼亚北部)/ 亚太地区(东京))S3 官方列出的存储类别共 9 种:S3 Standard、S3 Intelligent-Tiering、S3 Express One Zone、S3 Standard-IA、S3 One Zone-IA、S3 Glacier Instant Retrieval、S3 Glacier Flexible Retrieval、S3 Glacier Deep Archive 和 S3 Outposts。不过 S3 Outposts 是把数据放在本地部署的 Outposts 机架上的特殊类别,其前提与「如何对区域内的云存储进行分层」这一问题并不相同。在普通区域中可作为分层设计候选的是除 Outposts 之外的 8 种,其中 Intelligent-Tiering 并非单独的层级,而是下一节讨论的自动分层类别。Standard 面向频繁访问的数据,提供最高可用性和低延迟。Standard-IA(Infrequent Access)面向访问频率低但需要即时检索的数据,存储单价为每 GB 每月 0.0125 美元(弗吉尼亚北部)/ 0.0138 美元(东京)。同等条件下 Standard 的前 50 TB 为 0.023 美元 / 0.025 美元,因此单价差在 45% 左右。One Zone-IA 存储在单个 AZ 中,比 Standard-IA 再便宜约 20%(AWS 官方说明,截至 2026 年 9 月),适合可重新生成的数据。Glacier Instant Retrieval 提供归档级价格但支持毫秒级检索,适合每季度访问一次左右的数据。Glacier Flexible Retrieval 提供分钟到小时级的检索时间,适合年度访问的数据。Glacier Deep Archive 是最便宜的类别,检索需要 12-48 小时(AWS 官方说明,截至 2026 年 9 月),适合合规保留等极少访问的数据。Express One Zone 是 2023 年新增的高性能类别,提供个位数毫秒延迟,适合频繁访问的小对象。Intelligent-Tiering 根据访问模式自动在各层间移动。

Intelligent-Tiering 的自动优化

S3 Intelligent-Tiering 自动监控对象的访问模式,将其自动移动到最具成本效益的存储层。自动运作的是 Frequent Access、Infrequent Access、Archive Instant Access 这 3 层:30 天未访问的对象移至 Infrequent Access 层,90 天未访问则移至 Archive Instant Access 层。这 3 层都是低延迟层,可在毫秒级完成检索;通过 GetObject 等访问对象时会自动移回 Frequent Access 层,且不产生额外的检索费用。此外可以选择启用 Archive Access 层(最短 90 天未访问后迁移)和 Deep Archive Access 层(最短 180 天未访问后迁移),但这 2 层以异步访问为前提,仅靠 GET 无法获取对象,需要通过 RestoreObject 请求显式恢复。「自动移回仅限于低延迟的 3 层」这一界线是设计上的分岔点。这种自动化的价值对于访问模式不可预测的数据集尤其显著。手动设计生命周期策略时,如果误判访问模式,可能把频繁访问的数据移到廉价层而导致检索费用累积。Intelligent-Tiering 大幅降低了这种估算失误带来的风险,但相应地会产生按对象计费的每月监控与自动分层费用(截至 2026 年 9 月的官方价格为每 1,000 个对象每月 0.0025 美元)。不足 128 KB 的对象不收取该费用,但也不会被自动分层,始终按 Frequent Access 层计费,因此在以小对象为主的存储桶中几乎得不到节省效果。应用前应先确认对象大小的分布。

与 Azure Blob Storage 的比较

(截至 2026 年 8 月,Microsoft 官方文档记载值)Azure Blob Storage 提供 Hot、Cool、Cold、Archive 四种访问层。建议的最短保留期为 Cool 30 天、Cold 90 天、Archive 180 天,在此期间内删除或移至其他层会产生提前删除费用。Hot、Cool、Cold 是在线层,可毫秒级访问;Archive 则是离线层,读取前需要先解冻到在线层,根据指定的优先级最长可能需要 15 小时。相比之下,S3 按检索时间把归档区间分为 3 种类别,只需选择类别即可指定 Glacier Instant Retrieval 的「接近归档的单价且可毫秒级检索」或 Glacier Flexible Retrieval、Glacier Deep Archive 的「更便宜但需等待数小时」。在 Azure 中承担这一中间区间的是在线层 Cold,但 Cold 的读取侧计费设计得比 Cool 高,而最便宜的 Archive 是离线层,形成二分格局,因此在「既要便宜又要即时」的需求下只能在其中一方妥协。在自动分层方面,Azure 也具备 Smart tier,可根据使用模式在 Hot、Cool、Cold 之间自动移动。Lifecycle Management 的规则条件除创建时间和最后修改时间外,(启用访问时间跟踪后)还可以使用最后访问时间。不过 Lifecycle Management 策略无法把 Archive 层的 Blob 移回在线层,因此已降到离线层的数据需要通过 Copy Blob 等另行设计恢复方式。

与 GCS 的比较

GCS(Google Cloud Storage)提供 Standard、Nearline、Coldline、Archive 四种存储类别。GCS 的特点是所有类别提供相同的 API 和延迟。从 Coldline 和 Archive 检索也能以与 Standard 相同的速度进行,无需担心检索时间。这种设计简化了应用开发,但代价是无法像 S3 那样通过接受更长的检索时间来获得更低的存储价格。GCS 的 Autoclass 功能类似于 Intelligent-Tiering,根据访问模式自动移动对象,但层级数量较少,优化的精细度不及 S3。

存储分层的实践设计指南

有效利用存储分层的出发点是准确把握数据的访问模式。S3 Storage Lens 可视化整个存储桶的访问模式,分析各前缀的访问量。对访问模式明确的数据应用生命周期策略,对模式不明确的数据应用 Intelligent-Tiering 是基本策略。对于大型数据湖,建议组合使用:热数据用 Standard,温数据用 Intelligent-Tiering(自动优化),冷数据用 Glacier Instant Retrieval,归档数据用 Glacier Deep Archive。

总结

AWS S3 的存储类别群能够根据访问频率和检索要求的组合实现精密的成本优化。与 Azure Blob Storage 的 4 层和 GCS 的 4 种类别相比,S3 按检索时间把归档区间分为 3 种类别,只需选择类别就能满足「接近归档的单价且可毫秒级检索」这一需求,这是实务上的差异化要点。Intelligent-Tiering 的自动优化对于访问模式不可预测的数据集,能同时减轻手动管理的负担和设计失误带来的成本风险。不过监控与自动分层费用、不足 128 KB 对象的处理方式、可选层需要 RestoreObject 等都是附带的前提条件,应在确认目标数据的性质后再决定适用范围。

参考资料(AWS 官方)

本页的第一手信息来源是 AWS 官方网站及官方文档。最新的规格与价格请以下列官方页面为准。

如本页内容与官方文档不一致,请以官方文档为准。