•  在企业为AI平台选择存储设备之前,必须首先考虑以下几点:

      1、成本。AI数据存储设备的价格对企业来说是一个关键因素。显然,高管层和那些参与采购决策的人会希望存储尽可能具有成本效益,商汤科技认为在许多情况下,这将影响组织的产品选择和策略。

      2、可伸缩性。如上文所说,在创建机器学习或AI模型的过程中,收集、存储和处理大量数据是非常必要的。机器学习算法要求源数据呈指数增长,才能实现精度的线性提高。创建可靠而准确的机器学习模型可能需要数百TB甚至PB的数据,而且这只会随着时间的推移而增加。

      构建PB级存储系统,一般需要使用对象存储或横向扩展文件系统。如今的对象存储当然可以满足AI工作负载的容量需求,但它们可能无法满足其他标准,如高性能。横向扩展文件系统可以提供高性能和良好的可伸缩性,但是将整个数据集存储在一个平台上可能会很昂贵。另外,出于可伸缩性需求和高容量产品的成本,块存储往往不是机器学习或人工智能的正确选择。这里唯一的例外是公有云,稍后我们对此进行讨论。

      存储成本的变化引入了分层存储或使用多种类型的存储来存储数据的概念。例如,对象存储是存储大量不活跃的AI数据的良好目标。当需要处理数据时,可以将数据移动到对象存储中的高性能文件存储集群或节点上,一旦处理完成,就可以将数据移动回来。

      3、性能。AI数据的存储性能有三个方面。首先,可能也是最重要的是延迟,也就是软件处理每个I/O请求的速度。低延迟很重要,因为改善延迟对创建机器学习或AI模型所需的时间有直接影响。复杂的模型开发可能需要数周或数月的时间。通过缩短这个开发周期,组织可以更快地创建和细化模型。在检查延迟能力时,由于对象访问的流特性,对象将引用时间存储为第一个字节,而不是单个I/O请求的延迟。

      性能的另一个方面是吞吐量,以及从存储平台写入或读取数据的速度。系统吞吐量很重要,因为AI训练需要处理大量数据集,经常重复读取相同的数据,以准确地开发模型。机器学习和AI数据的来源,例如自动驾驶汽车上的传感器,每天可以生成多个TB的新数据。所有这些信息都必须添加到现有的数据存储中,并且对任何现有处理的影响要最小。

     

      性能的最后一个方面是并行访问。机器学习和AI算法并行处理数据,运行多个任务,这些任务可以多次读取相同的数据,并跨越多个并行任务。对象存储擅长并行读取I/O处理,因为不需要管理对象锁或属性。文件服务器跟踪内存中打开的I/O请求或文件句柄。因此,活动I/O请求的数量取决于平台上可用的内存。

      机器学习数据可以由大量的小文件组成。在这个领域,文件服务器可以提供比对象存储更好的性能。这里需要问AI存储方案供应商的一个关键问题是,在大文件类型和小文件类型上,他们的产品的性能特征会如何变化。

      4、可用性和耐久性。机器学习和AI模型可以长时间连续运行。通过训练开发算法可能需要几天或几周的时间。在此期间,存储系统必须保持启动并持续可用。这意味着任何升级、技术替换或系统扩展都需要在不停机的情况下进行。

      在大型系统中,组件故障是常见的。这意味着任何用于AI工作的平台都应该能够从设备(如硬盘或SSD)和节点或服务器故障中恢复。对象存储使用擦除编码在许多节点上广泛分布数据,并最小化组件故障的影响。有一些擦除编码技术可以用在横向扩展文件系统,以提供同等水平的弹性。擦除编码方案的效率非常重要,因为它直接关系到读写I/O的性能,特别是对于小文件而言。

      由于多数大规模对象存储都太大,无法定期备份,因此可靠的擦除编码成为AI存储平台的一个基本特性。

    本站所有文章及内容系第三方作者上传,如有侵权行为请及时联系本站客服QQ:2371406255删除,本站不对内容传播行为承担赔偿责任!