flowchart LR
A["1956-1970<br/>初创期"] --> B["1970-1980<br/>AI寒冬"]
B --> C["1980-1990<br/>专家系统"]
C --> D["1990-2010<br/>机器学习"]
D --> E["2010-2020<br/>深度学习"]
E --> F["2020-至今<br/>大模型时代"]
style A fill:#e3f2fd
style B fill:#ffebee
style C fill:#fff3e0
style D fill:#e8f5e9
style E fill:#f3e5f5
style F fill:#e0f2f1,color:#004d40
flowchart TD
subgraph 国外模型["🌍 国外模型"]
M1["GPT-4/4o<br/>OpenAI"]
M2["Claude 3<br/>Anthropic"]
M3["Gemini 1.5<br/>Google"]
end
subgraph 国内模型["🇨🇳 国内模型"]
M4["通义千问 Qwen<br/>阿里"]
M5["文心一言<br/>百度"]
M6["DeepSeek<br/>深度求索"]
M7["混元<br/>腾讯"]
end
subgraph 开源模型["🔓 开源模型"]
O1["Llama 3<br/>Meta"]
O2["Qwen2<br/>阿里"]
O3["GLM-4<br/>智谱"]
end
模型
特点
适用场景
GPT-4/4o
综合能力最强,多模态
通用任务、复杂推理
Claude 3
长上下文,写作质量高
长文档处理、内容创作
DeepSeek
性价比高,代码能力强
软件开发、成本敏感场景
通义千问
中文能力强,生态丰富
中文内容、企业应用
文心一言
中文理解好,百度生态
国内企业应用
Llama 3
开源可私有部署
数据敏感场景
三、Transformer 架构详解
3.1 核心机制
flowchart LR
A["输入文本"] --> B["Tokenization<br/>分词"]
B --> C["Embedding<br/>向量化"]
C --> D["Positional Encoding<br/>位置编码"]
D --> E["Multi-Head Attention<br/>多头注意力"]
E --> F["Feed Forward Network<br/>前馈网络"]
F --> G["Layer Normalization<br/>层归一化"]
G --> H["输出层<br/>生成Token"]
style E fill:#fff3e0
style F fill:#fff3e0
3.2 注意力机制
graph LR
A["查询 Query"] --> D["注意力权重"]
B["键 Key"] --> D
C["值 Value"] --> D
D --> E["加权输出"]
style D fill:#FF6B6B,color:#fff
flowchart TD
A["文本:'我喜欢人工智能'"] --> B["Embedding模型"]
B --> C["向量:[0.12, -0.45, 0.78, ...]"]
C --> D["存储在向量数据库中"]
E["查询:'AI是什么'"] --> F["Embedding模型"]
F --> G["向量:[0.15, -0.42, 0.81, ...]"]
G --> H["相似度检索"]
H --> I["返回最相关的文档"]
style C fill:#e3f2fd
style G fill:#e8f5e9
5.2 向量数据库选型
pie title 向量数据库使用场景分布
"轻量级/开发测试<br/>Chroma" : 30
"生产环境/分布式<br/>Milvus/Pinecone" : 35
"高性能/单机部署<br/>FAISS" : 20
"商业托管<br/>Pinecone/Weaviate" : 15
flowchart LR
A["AI发展六阶段"] --> B["Transformer是基石"]
B --> C["LLM是核心能力"]
C --> D["向量数据库是记忆"]
D --> E["RAG/Agent是应用形态"]
style A fill:#e3f2fd
style B fill:#fff3e0
style C fill:#e8f5e9
style D fill:#f3e5f5
style E fill:#fce4ec