[关闭]
@lsmn 2016-06-21T13:38:27.000000Z 字数 1436 阅读 2350

Neha Narkhede: 借助Apache Kafka实现大规模流处理

Apache Kafka 流处理


摘要

在QCon纽约2016大会上,Neha Narkhede在演讲“借助Apache Kafka实现大规模流处理”中介绍了Kafka Streams,这是Kafka用于处理流式数据的新特性。据Narkhede介绍,因为“无界(unbounded)”数据集随处可见,所以流处理越来越流行。那不再是一个像机器学习那样的小众问题。

正文

QCon纽约2016大会上,Neha Narkhede在演讲“借助Apache Kafka实现大规模流处理”中介绍了Kafka Streams,这是Kafka用于处理流式数据的新特性。据Narkhede介绍,因为“无界(unbounded)”数据集随处可见,所以流处理越来越流行。那不再是一个像机器学习那样的小众问题。

Narkhede首先介绍了数据操作的基本编程范式:

然后,Narkhede提供了一个来自零售领域的流处理实例:销售和发货从根本上说是无界数据集,流处理可以有效地处理这样的数据集。销售和发货是一个事件流(“发生了什么”)和基于这些事件重新计算价格(“做些什么”)的函数是流处理器。

在考虑流处理时,Narkhede提到了开发人员如今可以选择的两个最流行的选项。第一,开发人员可以自己实现,对于简单的场景而言,这可能还说得过去,但当加入像订购、扩展性、容错性或处理历史数据这样的特性时,情况会变得非常复杂。第二,开发人员可以选择像Spark或Samza这样的解决方案,它们都是重量级的,而且一般说来是为map/reduce而设计的。但在Narkhede看来,流处理更像基于事件的微服务,而不是map/reduce,而这就是Kafka Streams的设计初衷。

Kafka Streams是一个轻量级的库,可以嵌入应用程序,而且对打包或部署没有施加任何限制。Narkhede接下来概括地介绍了如何实现流处理系统的重要功能。

接下来,Narkhede介绍了Kafka Streams的双重性,作为实现给定特性的基本原则:从根本上讲,就是表(“状态”)和流(“状态如何变化”)的概念相结合。因此,基于Kafka Streams的应用程序可以同时具备响应性和状态。另外,同时具备这两个概念还会简化架构。

Neha Narkhede在结尾时简单地介绍了一下Kafka Connect,这是一个副项目,可以连接各种数据库、Hadoop或Elasticsearch等系统,向Kafka输入数据或从Kafka获取数据。

请注意,大部分QCon讲稿都将在会后数周在InfoQ上提供,而幻灯片可以从大会的官方网站上下载。

查看英文原文:Neha Narkhede: Large-Scale Stream Processing with Apache Kafka

添加新批注
在作者公开此批注前,只有你和作者可见。
回复批注