数据基础

🗂️ 内容导航

名称说明链接
09 — 数据库设计进入
10 — 缓存系统设计进入
11 — 消息队列进入

核心观点:数据是AI的燃料,理解数据处理是构建智能系统的基础。


📊 数据体系

graph TB
    subgraph 数据存储
        S1["关系数据库<br/>结构化数据"]
        S2["NoSQL数据库<br/>非结构化"]
        S3["数据仓库<br/>分析存储"]
    end    
    subgraph 数据处理
        P1["批处理<br/>离线计算"]
        P2["流处理<br/>实时计算"]
        P3["图计算<br/>关系分析"]
    end    
    subgraph 数据分析
        A1["描述性分析<br/>现状描述"]
        A2["诊断性分析<br/>原因分析"]
        A3["预测性分析<br/>未来预测"]
    end
    
    S1 & S2 & S3 --> P1 & P2 & P3
    P1 & P2 & P3 --> A1 & A2 & A3
    
    style S1 fill:#ffebee
    style P1 fill:#e3f2fd
    style A1 fill:#e8f5e9

🗄️ 数据库

关系数据库

概念内涵例子
表数据集合用户表
行数据记录一条用户
列数据字段用户名
主键唯一标识用户ID
外键表间关联订单用户ID

SQL语言

-- 基本操作
SELECT * FROM users WHERE age > 18;
INSERT INTO users (name, age) VALUES ('张三', 25);
UPDATE users SET age = 26 WHERE name = '张三';
DELETE FROM users WHERE name = '张三';

NoSQL数据库

类型特点例子
键值存储简单高效Redis
文档存储灵活模式MongoDB
列存储高压缩率HBase
图数据库关系分析Neo4j

📈 数据处理

大数据处理

graph TB
    subgraph 批处理
        A1["MapReduce<br/>离线计算"]
        A2["Spark<br/>内存计算"]
        A3["Hive<br/>数据仓库"]
    end    
    subgraph 流处理
        B1["Flink<br/>实时流"]
        B2["Kafka<br/>消息队列"]
        B3["Storm<br/>实时计算"]
    end
    
    A1 & A2 & A3 --> B1 & B2 & B3
    
    style A1 fill:#ffebee
    style B1 fill:#e3f2fd

数据清洗

任务描述方法
缺失值处理补全缺失数据均值、中位数、插值
异常值检测识别异常数据3σ原则、IQR
重复值处理删除重复记录去重
格式标准化统一数据格式类型转换

特征工程

特征工程方法:
1. 特征选择:选择重要特征
2. 特征提取:从原始数据提取
3. 特征构造:组合现有特征
4. 特征缩放:标准化、归一化

📊 数据可视化

可视化类型

类型适用场景工具
折线图趋势变化Matplotlib
柱状图对比分析Seaborn
散点图相关分析Plotly
热力图矩阵数据Bokeh

可视化原则

数据可视化四原则:
1. 准确性:真实反映数据
2. 简洁性:去除无关元素
3. 有效性:传达核心信息
4. 美观性:视觉吸引力

🎯 核心结论

数据处理原则

  1. 数据质量:垃圾进垃圾出
  2. 数据安全:隐私保护
  3. 数据治理:规范管理
  4. 数据价值:挖掘洞察
  5. 数据共享:开放协作

数据发展趋势

数据发展四大趋势:
1. 数据湖:统一存储
2. 数据编织:智能集成
3. 数据网格:去中心化
4. 数据民主化:人人可用

📚 参考文献

  1. 《数据库系统概论》- 王珊
  2. 《数据密集型应用系统设计》
  3. 《Python数据分析》
  4. 《大数据技术原理与应用》
  5. 《数据可视化》
  6. 《数据治理》
  7. 《机器学习实战》
  8. 《SQL必知必会》

3 items under this folder.