数据处理行业新晋从业人员必读

Item: Designing Data-Intensive Applications
Rating: 5
Author: 思寇特牌搬砖工

思寇特牌搬砖工评论 Designing Data-Intensive Applications 5

2017-11-17 13:42:02

大概十一放假开始读这本书，中间经历了加班，双十一值班，自己病假，老婆生病请病假，娃生病请病假，断断续续到现在终于算是从头到尾看了一遍，实在是觉得不容易。

这本书的作者是少有的从工业界干到学术界的牛人，知识面广得惊人，也善于举一反三，知识之间互相关联，比如有个地方把读路径比作programming language的lazy evaluation而写路径比作eager evaluation，令人拍案。这一本数囊括了几乎所有数据处理相关工作中可能遇到了的内容，而且也有非常棒的实操经验。比如书的一开始，作者反复强调监控中分位数的作用，可以揭示一些被平均数掩盖的事实，我也正好有一个监控从都是监控平均值变成主要监控若干p99分位数的经历，看到这里，不由得掩卷叹息。

我做数据处理也就是不到三年，接触过不少相关的工具，可以说Hadoop啊，pig啊，Hive啊，Storm啊，你的确不去了解它们背后的原理理念也可以用，但是真正要整合它们，做一个容错，可扩展，可维护的数据产品，则需要相当的分布式和数据系统的insight。帮助你建立这样的insight的书，应该是比较缺乏的，你可以去刷分布式系统的课程，看paper，但是阅读一本one in all的书，ROI可能是最高的。之前也有人尝试过，比如有国人写的《大数据日知录》，其实写得也算不错，但是不知道是笔力不济还是什么缘故，最后也是沦为技术文档的罗列。

这本书循循善诱的写作手法应该是相当高超了，讲解得非常深入浅出，一般照着提出问题 -> 解决方案 -> 这个方案的长处短处 -> 发散到其它方案这个模式讲解，看起来可以说是不知不觉，非常轻松，也没有有些作者的拽文习惯，几乎全部是中学词汇，句子也不复杂，保证非英语母语的人可以流畅阅读，这点可以说是非常良心了。

作者在最后一小节还讨论了大数据的伦理问题，尽管现实世界中，金钱利益面前，可能无人理会这些事情，但是这些夫子自道，还是很体现作者情怀。我觉得这是升华整本书的地方。

本书references超级多，可能正文内容止于guide，老手可能觉得不过蜻蜓点水，那么看看每章后面的几百个ref，那里可以发现更广阔的世界。

有关键情节透露