Spark将机器学习与GPU加速机制纳入自身

译文
服务器 存储 Spark
此次推出的新功能——即GPU加速与多套深度学习库集成——在理论上能够实现Apache Spark在任意位置的安装工作。不过Databricks方面表示,其版本目前仍处于调整阶段,这是为了避免资源争用情况给功能的实际使用带来复杂性影响

【51CTO.com快译】

Databricks公司通过简化对GPU加速型机器学习方案的访问支持自家云Spark服务。

[[174832]]

 

作为Apache Spark内存内大数据项目的支持与开发合作厂商,Databricks公司已经对其自家Apache Spark云实现方案进行两轮支持升级,旨在让更多IT用户享受其便利。

此次推出的新功能——即GPU加速与多套深度学习库集成——在理论上能够实现Apache Spark在任意位置的安装工作。不过Databricks方面表示,其版本目前仍处于调整阶段,这是为了避免资源争用情况给功能的实际使用带来复杂性影响。

Apache Spark本身并不具备开箱即用的GPU加速功能,且需要设置一套系统对此加以支持,这意味着用户需要面对多种复杂组件。有鉴于此,Databrick公司决定承担起相关难题。

Databricks方面还宣称,其将降低节点间的资源争用数量,从而***程度保证Spark的运作能够充分发挥GPU集群的性能优势。这一思路与麻省理工学院的Milk库看起来非常类似,后者同样利用加速机制并发处理应用,旨在确保与内存相关的操作以批量方式进行,最终实现对系统缓存资源的***化利用。Databricks公司的设置能够保证各项GPU操作之间不会相互导致冲突乃至中断。

另一项能够显著节约时间的举措在于直接访问多种主流机器学习库,这意味着Spark将可作为数据源起效。其中包括Databricks自家的TensorFrames库,其允许将TensorFlow库与Spark相配合,同时实现GPU加速能力。

Databricks 公司已经在推文中表示,其基础设施能够充分利用Spark的自身优势。其建立起免费级服务,用以吸引那些仍对深度使用Spark抱有警惕心理的客户,包括为其提供完整产品中的部分功能。根据InfoWorld网站此前发布的评测报告,Databricks的免费产品确实相当出色且易于上手。

 

不过市场竞争仍然相当激烈,特别是考虑到Databricks需要面对像微软(拥有Azure机器学习方案)、IBM以及Amazon这样的巨头级对手。因此,其必须找到保持并扩大服务受众规模的可行途径,并专注于打造自身独特的服务产品。除了添加机器学习与GPU加速等功能之外,Databricks还需要在发展计划中确保新特性能够切实带来便利——而非提升复杂程度。

原文标题:Spark picks up machine learning, GPU acceleration,原文作者:Serdar Yegulalp

【51CTO译稿,合作站点转载请注明原文译者和出处为51CTO.com】

责任编辑:云中子 来源: 51cto
相关推荐

2018-06-23 13:55:15

Apache SparPython数据

2017-04-13 13:30:56

SparkSpark MLlib机器学习

2021-12-09 09:53:00

人工智能机器学习网络安全

2017-12-06 08:06:47

IBMGPU机器学习

2021-09-12 13:23:38

微软WSL机器学习

2017-05-02 08:52:08

DevOps网络安全AI

2017-07-26 17:25:22

机器学习SparkAPI

2014-08-14 08:55:11

2022-10-25 16:18:41

人工智能机器学习金融

2019-08-06 17:19:22

开源技术 趋势

2018-07-31 09:52:38

机器学习排序算法图像处理

2010-06-25 11:14:34

Facebook谷歌

2021-05-17 10:36:36

高级分析企业战略CIO

2021-06-15 08:00:00

人工智能机器学习应用

2019-08-21 09:24:45

GPUCPU深度学习

2018-03-21 10:14:38

JavaScript交叉GPU

2018-05-25 19:45:44

企业机器学习研究

2018-05-27 11:37:07

Cloudera机器学习研究

2021-09-13 13:43:43

图数据科学

2019-09-30 07:04:56

开源道德条款开发者
点赞
收藏

51CTO技术栈公众号