知识库 - Orange

VLM模型概述

Large Model

2026-03-04

Qwen-VL系列 Qwen-VL 阿里巴巴的Qwen-VL是另一个比较经典的模型，十分值得作为案例介绍多模态大模型的训练要点。Qwen-VL使用Qwen-7B LLM作为语言模型基座，Openclip预训练的ViT-bigG作为视觉特征Encoder，随机初始化的单层Cross-Attention模块作为视觉和自然语言的的Adapter，总参数大小约9.6B。如下图，Qwen-VL的训练过程分为三个阶段： Stage1 为预训练，目标是使用大量的图文Pair对数据对齐视觉模块和LLM的特征，这个阶段冻结LLM模块的参数； Stage2 为多任务预训练，使用更高质量的图文多任务数据（主要来源自开源VL任务，部分自建数据集），更高的图片像素输入，全参数训练； Stage3 为指令微调阶段，这个阶段冻结视觉Encoder模块，使用的数据主要来自大模型Self-Instruction方式自动生成，目标是提升模型的指令遵循和多轮对话能力。...

#VLM

READ

LLaVA系列

Large Model

2026-03-04

项目： https://llava-vl.github.io/ github: https://github.com/haotian-liu/LLaVA 一句话优点：极大简化了VLM的训练方式：Pre-training + Instruction Tuning 训练量得到简化：1M量级数据+ 8卡A100 → 一天完成训练 LLaVA LLaVA是2023的连续工作，包含了LLaVA 1.0, 1.5, 1.6几个版本（后续会有更多），也是2023年多模态领域妥妥的顶流。发表9个月620的stars，GitHub超过12K的stars。 LLaVA它的网络结构简单、微调成本比较低，任何研究组、企业甚至个人都可以基于它构建自己的领域的多模态模型。非常建议对多模态大模型感兴趣的朋友关注LLaVA这篇工作。简介...

#VLM

READ

Deep Generative Models概述

Generative Model

2026-03-04

简介如果以概率的视角看待世界的生成模型。在这样的世界观中，我们可以将任何类型的观察数据（例如 \(D\) ）视为来自底层分布（例如 \( p_{data}\) ）的有限样本集。任何生成模型的目标都是在访问数据集 \(D\) 的情况下近似该数据分布。如果我们能够学习到一个好的生成模型，我们可以将学习到的模型用于下游推理。我们主要对数据分布的参数近似感兴趣，在一组有限的参数中，它总结了关于数据集 \(D\) 的所有信息。与非参数模型相比，参数模型在处理大型数据集时能够更有效地扩展，但受限于可以表示的分布族。在参数的设置中，我们可以将学习生成模型的任务视为在模型分布族中挑选参数，以最小化模型分布和数据分布之间的距离。如上图，给定一个狗的图像数据集，我们的目标是学习模型族 \(M\) 中生成模型 θ 的参数，使得模型分布 \(p_θ\) 接近 \(p_{data}\) 上的数据分布。在数学上，我们可以将我们的目标指定为以下优化问题: \[\mathop{min}\limits_{\theta\in M}d(p_\theta,p_{data})\] 其中， \(d()\)...

#Autoregressive #Generating Model #VAE

READ

Math

Algorithm

2026-02-25

48. 旋转图像题目给定一个 \(n × n\) 的二维矩阵 matrix 表示一个图像。请你将图像顺时针旋转 90 度。你必须在原地旋转图像，这意味着你需要直接修改输入的二维矩阵。请不要使用另一个矩阵来旋转图像。示例 1：输入：matrix = [[1,2,3],[4,5,6],[7,8,9]] 输出：[[7,4,1],[8,5,2],[9,6,3]] 示例 2：输入：matrix = [[5,1,9,11],[2,4,8,10],[13,3,6,7],[15,14,12,16]] 输出：[[15,13,2,5],[14,3,4,1],[12,6,8,9],[16,7,10,11]] 提示： n == matrix.length == matrix[i].length 1 <= n <= 20 -1000 <= matrix[i][j] <= 1000 题解这是一个经典的矩阵操作问题。要在原地（In-place）将图像顺时针旋转 90 度，我们可以利用矩阵的几何性质。最直观且易于实现的方法是将...

#Algorithm

READ

算法与数据结构

Algorithm

2026-02-25

线性结构与技巧基础容器数组 (Array) 链表 (Linked List) 字符串 (String) KMP算法核心技巧双指针滑动窗口二分查找栈与队列栈 & 队列 (Stack & Queue) 单调队列树与图论树与堆 (Tree & Heap) 树的遍历二叉树堆（大顶堆&小顶堆）优先队列图 (Graph) 搜索(BFS/DFS) 最小生成树核心算法思想动态规划 (DP) 基础 DP 背包问题排序基础排序算法排序算法数据处理哈希表 Math

#Algorithm

READ

KMP算法

Algorithm

2026-02-25

kmp算法用于字符串的模式匹配，也就是找到模式字符串在目标字符串的第一次出现的位置比如 abababc 那么 bab 在其位置1处， bc 在其位置5处，我们首先想到的最简单的办法就是蛮力的一个字符一个字符的匹配，但那样的时间复杂度会是 \(O(m*n)\) 。kmp算法保证了时间复杂度为 \(O(m+n)\) 。基本原理举个例子：发现 x 与 c 不同后，进行移动 a 与 x 不同，再次移动此时比较到了 c 与 y ，于是下一步移动成了下面这样这一次的移动与前两次的移动不同，之前每次比较到上面长字符串的字符位置后，直接把模式字符串的首字符与它对齐，这次并没有，原因是这次移动之前， y 与 c 对齐，但是 y 前边的 ab 是与自己的前缀 ab 一样，于是 ab 并不用再比较，直接从第三个位置开始比较，如图：所以说 kmp算法对于这种情况就直接使用当前比较字符之前的最长相同的前后缀，然后将前缀与上面的长字符串对齐，继续比较后面的字符串。这里kmp算法中的一个重要点就来了，如何找到模式字符串中每位字符之前的最长相同前后缀呢这里继续用一个例子举例：下面的数字记录...

#Algorithm

READ

二分查找

Algorithm

2026-02-25

💡 不断排除不存在解的区间，直至最后剩下一个这里归纳最重要的部分：分析题意，挖掘题目中隐含的单调性； while (left < right) 退出循环的时候有 left == right 成立，因此无需考虑返回 left 还是 right ；始终思考下一轮搜索区间是什么，如果是 [mid, right] 就对应 left = mid ，如果是 [left, mid - 1] 就对应 right = mid - 1 ，是保留 mid 还是 +1、−1 就在这样的思考中完成；从一个元素什么时候不是解开始考虑下一轮搜索区间是什么，把区间分为 2个部分（一个部分肯定不存在目标元素，另一个部分有可能存在目标元素），问题会变得简单很多，这是一条非常有用的经验；每一轮区间被划分成 2 部分，理解区间划分决定中间数取法（无需记忆，需要练习 + 理解），在调试的过程中理解区间和中间数划分的配对关系：划分 [left, mid] 与 [mid + 1, right] ，mid 被分到左边，对应 int mid = left + (right - left) / 2 ;...

#Algorithm

READ

排序算法

Algorithm

2026-02-25

164. 最大间距题目给定一个无序的数组，找出数组在排序之后，相邻元素之间最大的差值。如果数组元素个数小于 2，则返回 0。 Example 1: Input: [3,6,9,1] Output: 3 Explanation: The sorted form of the array is [1,3,6,9], either (3,6) or (6,9) has the maximum difference 3. 题解如果进行排序，这里会超时。采用桶排序基础排序算法的思想，可以在线性时间解决。首先建立桶，每个桶中只需要存放这个桶中元素的最大值和最小值。我们期望将数组中的各个数等距离分配，也就是每个桶的长度相同，也就是对于所有桶来说，桶内最大值减去桶内最小值都是一样的。可以当成公式来记。 \[每个桶的长度=\max(1,\lfloor{{\max(nums)-\min(nums)}\over{len(nums)-1}}\rfloor)\tag{1}\]...

#Algorithm

READ

基础排序算法

Algorithm

2026-02-25

排序算法是《数据结构与算法》中最基本的算法之一。排序算法可以分为内部排序和外部排序，内部排序是数据记录在内存中进行排序，而外部排序是因排序的数据很大，一次不能容纳全部的排序记录，在排序过程中需要访问外存。常见的内部排序算法有：插入排序、希尔排序、选择排序、冒泡排序、归并排序、快速排序、堆排序、基数排序等。用一张图概括：冒泡排序冒泡排序（Bubble Sort）是一种简单的排序算法，它通过重复地遍历待排序的列表，比较相邻的元素并交换它们的位置来实现排序。该算法的名称来源于较小的元素会像"气泡"一样逐渐"浮"到列表的顶端。算法步骤比较相邻元素：从列表的第一个元素开始，比较相邻的两个元素。交换位置：如果前一个元素比后一个元素大，则交换它们的位置。重复遍历：对列表中的每一对相邻元素重复上述步骤，直到列表的末尾。这样，最大的元素会被"冒泡"到列表的最后。缩小范围：忽略已经排序好的最后一个元素，重复上述步骤，直到整个列表排序完成。假设有一个待排序的列表 [5, 3, 8, 4, 6] ，冒泡排序的过程如下：第一轮遍历：比较 5 和 3，交换位置，列表变为 [3,...

#Algorithm

READ

搜索(BFS/DFS)

Algorithm

2026-02-25

DFS 39&40. 组合总和题目给你一个无重复元素的整数数组 candidates 和一个目标整数 target ，找出 candidates 中可以使数字和为目标数 target 的所有不同组合，并以列表形式返回。你可以按任意顺序返回这些组合。 candidates 中的同一个数字可以无限制重复被选取。如果至少一个数字的被选数量不同，则两种组合是不同的。对于给定的输入，保证和为 target 的不同组合数少于 150 个。示例 1：输入：candidates = [2,3,6,7], target = 7 输出：[[2,2,3],[7]] 解释： 2 和 3 可以形成一组候选，2 + 2 + 3 = 7 。注意 2 可以使用多次。 7 也是一个候选， 7 = 7 。仅有这两种组合。示例 2：输入: candidates = [2,3,5], target = 8 输出: [[2,2,2,2],[2,3,3],[3,5]] 示例 3：输入: candidates = [2], target = 1 输出: [] 提示： 1 <=...

#Algorithm

READ

树的遍历

Algorithm

2026-02-25

二叉树结构 class TreeNode: def __init__(self, x): self.val = x self.left = None self.right = None 递归时间复杂度： \(O(n)\) ， \(n\) 为节点数，访问每个节点恰好一次。空间复杂度：空间复杂度： \(O(h)\) ， \(h\) 为树的高度。最坏情况下需要空间 \(O(n)\) ，平均情况为 \(O(logn)\) 递归1: 二叉树遍历最易理解和实现版本 class Solution: def preorderTraversal(self, root: TreeNode) -> List[int]: if not root: return [] # 前序递归 return [root.val] + self.preorderTraversal(root.left) + self.preorderTraversal(root.right) ...

#Algorithm

READ

二叉树

Algorithm

2026-02-25

236. 二叉树的最近公共祖先给定一个二叉树, 找到该树中两个指定节点的最近公共祖先。百度百科中最近公共祖先的定义为：“对于有根树 \(T\) 的两个节点 \(p\) 、 \(q\) ，最近公共祖先表示为一个节点 \(x\) ，满足 \(x\) 是 \(p\) 、 \(q \) 的祖先且 \(x\) 的深度尽可能大（一个节点也可以是它自己的祖先）。” 示例 1：输入：root = [3,5,1,6,2,0,8,null,null,7,4], p = 5, q = 1 输出：3 解释：节点 5 和节点 1 的最近公共祖先是节点 3 。示例 2：输入：root = [3,5,1,6,2,0,8,null,null,7,4], p = 5, q = 4 输出：5 解释：节点 5 和节点 4 的最近公共祖先是节点 5 。因为根据定义最近公共祖先节点可以为节点本身。示例 3：输入：root = [1,2], p = 1, q = 2 输出：1 提示：树中节点数目在范围 [2, 10 5 ] 内。 -10 9 <= Node.val <= 10 9 所有 Node.val...

#Algorithm

READ

#

!

INCOMING TRANSMISSION

VLM模型概述

LLaVA系列

Deep Generative Models概述

Math

算法与数据结构

KMP算法

二分查找

排序算法

基础排序算法

搜索(BFS/DFS)

树的遍历

二叉树