近期,我在某些群众看到《数据可视化分析》第一版本的影印电子版,来自于某些人的扫码处理和 ZLibary 渠道。一些群友表示“喜乐君的书贵,但是值得”,也有一些学生表示“买不起”。
不过,我个人更痛心的是,第一版虽然流布颇广,但是受限于当时自己的认知水平,有一些显而易见的错误——我说的不是错别字,而是对于字段分类的认知错误。这也是我如今批评国产 BI 中常常提及的一点。
举例而言,第一版本中有这么一段:

在这里,看似没有问题,但其实存在一些逻辑混乱,这还是第六、第七次印刷时修改后的版本。这里的“量化字段”收到了某些图书影响,是为了后续更好的走向“度量”,但其实是错误的。如下所示:

在这里,“维度字段的聚合可以通过计算字段生成聚合”,可以简称“维度字段的聚合就是聚合指标”——这是错误的。这句话集中体现了逻辑上的混乱状态。
为此,我在2023年的第二版本中,彻底重写了几乎全部章节,避免收到之前逻辑的影响。正确的内容应该是:
- 维度和度量是问题上的定义,是问题的两个部分。不存在“维度的聚合”是度量的逻辑
- 字符串、数字也好,字符串、日期、整数、小数也好,是数据表明细行的字段分类,是为了优化存储而设定的,和问题没有关系,因此和维度、度量也没有关系。
- 不同数据类型的字段,有默认的维度、度量属性,但不是必然对应。比如【产品】默认是维度,但依然可以以聚合方式变成度量,比如【产品计数】;年龄可以构成问题的 维度部分,也可以增加聚合构成问题的度量部分。
- 不同年龄的人数
- 不同科室的平均年龄
因此,在第二版本中,使用了如下的逻辑图,从而表示了双层关系。

因此,强烈大家以第二版本为准。如果能在这个版本中发现明显原理性错误的,喜乐君大大有赏喔。