知识体系总览
理解大模型不是追逐最新的 benchmark 分数,而是建立从概率分布到涌现能力、从 Transformer 架构到 Agent 范式的第一性认知——知其然,更知其所以然。
原理优先——从神经网络的基本单元出发,逐层拆解 Transformer 的自注意力机制、Token 化与 Embedding 的本质,在底层建立对 LLM 的深刻直觉;
体系闭环——从基础概念到核心机制,从训练推理到上层应用,沿着"认知 → 训练 → 推理 → 应用 → 安全"的链路,构建完整的 LLM 知识拼图。

精选专题
基础入门
AI基础概念入门:核心概念解析
梳理人工智能、机器学习、神经网络、深度学习与大语言模型的五层同心圆结构,对比监督、无监督、强化学习三种训练范式,概览 CV、NLP、语音、推荐四大应用领域,并解析传统机器学习与神经网络模型的形态差异。
神经网络介绍:从一颗神经元到大语言模型
从单个人工神经元(加权求和+激活函数)出发,逐步剖析神经网络的训练循环(前向传播、损失函数、反向传播、梯度下降),解释深度学习逐层抽象的核心优势,并对比 FNN/CNN/RNN/Transformer 四种架构,最终揭示大语言模型如何将这套方法论做到千亿参数规模。
大模型架构基础:Transformer 内部结构详解
深入拆解 Transformer 内部六大组件的设计原理与演进逻辑:分词与嵌入的预处理、Attention 的全局通信机制、FFN 的知识存储、RoPE 的位置编码、RMSNorm 的训练稳定策略以及 LM Head 与 Temperature 的输出控制,完整勾勒大模型技术底座。
核心概念
LLM:大语言模型
全面梳理大语言模型的定义本质、2018-2026 发展简史、开源与闭源选型对比、通用与领域模型差异、Foundation Model 生态定位,以及涌现能力与幻觉现象的深层机理,构建 LLM 核心概念知识框架。
Token(词元):LLM 文本处理的最小单元与通用货币
从 Token 定义出发,详解 BPE、WordPiece 等四种主流子词分词算法原理,分析词表大小对模型效率与 API 成本的三重影响,并阐明 Token 与上下文窗口容量的换算关系,为 LLM 选型与成本优化提供基础认知。
上下文窗口:从“工作记忆”到能力边界
深入解析上下文窗口的定义、O(n²) 注意力复杂度瓶颈、Lost in the Middle 现象及其工程影响,并对比 NTK-aware Scaling、YaRN 等长上下文优化技术,为应用设计中的上下文管理提供实践指导。
Embedding 与向量化:从 Token 到语义搜索
从 Token Embedding 与 Sentence Embedding 的本质差异出发,详解专用嵌入模型的对比学习范式与主流模型选型,深入剖析语义搜索的向量相似度计算、ANN 近似检索算法及混合搜索策略,构建 Embedding 技术的完整知识体系。
训练与优化
推理与生成
推理与解码策略
系统拆解 LLM 推理时的核心解码策略:贪心解码与 Beam Search 的确定性路线、Top-k 与 Top-p 采样的随机性控制、温度系数对概率分布的调节机制,以及对比搜索等混合策略的设计思路与选型参考。
Prompt Engineering
全面解析 Prompt Engineering 方法论:从 System/User Prompt 分层设计到 Few-shot/Zero-shot 示例策略,涵盖 Chain-of-Thought 思维链、角色设定、输出格式控制等核心技巧,以及 Prompt 模板化与迭代优化的工程实践。
Context Engineering:上下文工程
阐述 Prompt Engineering 到 Context Engineering 的范式演进:从单次指令到为 LLM 构建包含 RAG 知识库、对话记忆、工具调用能力的持久认知环境,涵盖上下文窗口管理、长文本处理策略与多轮对话状态维护等工程实践。
温度系数与Top-p:掌控大模型的创造力开关
深度解读大模型 API 最核心的两个采样参数:Temperature 通过缩放 logits 调节概率分布陡峭度(低温保守、高温奔放),Top-p(核采样)以动态累积概率阈值裁剪长尾候选集。涵盖数学原理、交互效应、场景选型与调参最佳实践。
大模型推理部署:硬件、引擎、并行策略与连续批处理
系统梳理大模型推理部署的完整技术栈,涵盖GPU/NPU/TPU硬件选型与显存规划、vLLM/SGLang/TensorRT-LLM/llama.cpp/Ollama五大推理引擎对比、张量/流水线/数据/专家四种并行策略,以及Continuous Batching的调度机制与GPU利用率优化实践。
应用技术
大模型幻觉:成因、分类与缓解策略
深入剖析LLM幻觉的定义、分类与四大成因,系统介绍RAG、Grounding、约束解码、事实性校验四种缓解策略的原理与效果,并探讨幻觉与创造力的本质边界。
RAG 检索增强生成:从基础架构到高级范式
系统梳理RAG检索增强生成的完整技术栈,涵盖文档解析与Chunking策略、向量数据库选型与混合检索、Embedding模型对比与Reranking精排,以及GraphRAG、Agentic RAG、Multi-hop RAG三大高级范式。
Function Calling 工具调用:原理、定义与并行优化
深度解析LLM Function Calling的核心原理与工作流程,涵盖工具定义Schema设计、单次与多轮调用决策、并行调用优化策略,以及Structured Output与JSON Mode的区别及应用。
Agent
AI Agent 技术全景:从基础原理到多智能体协作
全面解析AI Agent的核心架构与运作原理,涵盖ReAct与Plan-and-Execute推理模式、三级记忆体系、Multi-Agent协作模式及Agent间通信方式,构建对Agent技术的系统认知。
MCP 与 A2A:Agent 通信协议深度解析
深度对比MCP与A2A两大Agent协议的设计理念、核心架构与适用场景,涵盖MCP的Client-Server架构与四大原语,以及A2A的Agent Card、Task生命周期与对等通信模型。
Agent 框架全景对比:从 LangGraph 到 OpenHarness
深度对比四大主流 Agent 框架的设计哲学与核心架构,涵盖 LangGraph 的有状态图执行、OpenClaw 的技能市场生态与 Heartbeat、Hermes 的 KEPA 自进化闭环,以及 OpenHarness 的六大支柱评估体系与 NLAH 基准。