知识库 - Orange

SigLIP系列

Large Model

2026-01-23

SigLIP 概述 CLIP自提出以来在zero-shot分类、跨模态搜索、多模态对齐等多个领域得到广泛应用。得益于其令人惊叹的能力，激起了研究者广泛的关注和优化。目前对CLIP的优化主要可以分为两大类：其一是如何降低CLIP的训练成本；其二是如何提升CLIP的performance。对于第一类优化任务的常见思路有3种。优化训练架构，如 LiT 通过freezen image encoder，单独训练text encoder来进行text 和image的对齐来加速训练；减少训练token，如 FLIP 通过引入视觉mask，通过只计算非mask区域的视觉表征来实现加速（MAE中的思路）优化目标函数，如 CatLIP 将caption转为class label，用分类任务来代替对比学习任务来实现加速。对于第二类提升CLIP的performance最常用和有效的手段就是数据治理，即构建高质量、大规模、高多样性的图文数据，典型的工作如：DFN。 SigLIP这篇paper 提出用sigmoid...

#VLM #pretrain

READ

BLIP系列：统一理解和生成的自举多模态模型

Large Model

2026-01-22

BLIP 论文名称：BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation (ICML 2022) 论文地址： https://arxiv.org/pdf/2201.12086.pdf 代码地址： https://github.com/salesforce/BLIP 官方解读博客： https://blog.salesforceairesearch.com/blip-bootstrapping-language-image-pretraining/ 背景和动机视觉语言训练 (Vision-Language Pre-training, VLP) 最近在各种多模态下游任务上取得了巨大的成功。然而，现有方法有两个主要限制：模型层面：大多数现有的预训练模型仅在基于理解的任务或者基于生成的任务方面表现出色，很少有可以兼顾的模型。比如，基于编码器的模型，像 CLIP，ALBEF 不能直接转移到文本生成任务...

#pretrain #VLM

READ

CLIP

Large Model

2026-01-22

CLIP算法原理 CLIP 不预先定义图像和文本标签类别，直接利用从互联网爬取的 400 million 个image-text pair 进行图文匹配任务的训练，并将其成功迁移应用于30个现存的计算机视觉分类。简单的说，CLIP 无需利用 ImageNet 的数据和标签进行训练，就可以达到 ResNet50 在 ImageNet数据集上有监督训练的结果，所以叫做 Zero-shot。 CLIP（contrastive language-image pre-training）主要的贡献就是利用无监督的文本信息，作为监督信号来学习视觉特征。 CLIP 作者先是回顾了并总结了和上述相关的两条表征学习路线：构建image和text的联系，比如利用已有的image-text pair数据集，从text中学习image的表征；获取更多的数据（不要求高质量，也不要求full...

#pretrain #VLM

READ

EDM

Generative Model

2026-01-19

基于文章《Elucidating the Design Space of Diffusion-Based Generative Models》来统一扩散模型框架通用扩散模型框架推导加噪公式 Flow Matching的一步加噪公式 \[\mathbf{x}_t=(1-t)\mathbf{x}_0+t\varepsilon\] 写成概率分布形式： \[p(\mathbf{x}_t|\mathbf{x}_0)=\mathcal{N}(\mathbf{x}_t;(1-t)\mathbf{x}_0,t^2\mathbf{I})\] Score Matching的一步加噪公式 \[\mathbf{x}_t=\mathbf{x}_0+\sigma_t\varepsilon \] 写成概率分布形式： \[p(\mathbf{x}_t|\mathbf{x}_0)=\mathcal{N}(\mathbf{x}_t;\mathbf{x}_0,\sigma_t^2\mathbf{I})\] DDPM/DDIM的一步加噪公式...

#ODE #diffusion #flow #SDE #Generating Model

READ

Query推荐

Search&Rec

2026-01-11

在电商搜索中，query推荐有很多种产品形态，不同的产品形态也扮演着不同的角色，常见的有query suggestion（SUG）、猜你想搜（搜索发现、大家都在搜）、细选（锦囊）、搜索底纹、搜索PUSH、搜索“风向标”（点击回退query推荐）等。以淘宝当前版本的产品形态为例，有：上述每个方向都值得单独介绍，而本文则先整体从query推荐角度，放在一起介绍，方便横向对比各个场景的目标和方法上的异同之处。而以经典的分类方式展开，可以将query 推荐策略放在用户搜索前、搜索中、浏览中、搜索后（本章不涉及讨论）等各个状态阶段来进行比较：目标以上引出了搜索query推荐的两大目标：搜索增长，目标提升提升渗透率，将用户引导到成交效率更高的搜索场景，提升搜索活跃度，常见的产品形态有：底纹、qu...

#搜索推荐

READ

搜索中的深度匹配模型

Search&Rec

2026-01-11

1. 搜索引擎概述 1.1 推荐和搜索比较推荐系统和搜索应该是机器学习乃至深度学习在工业界落地应用最多也最容易变现的场景。而无论是搜索还是推荐，本质其实都是匹配，搜索的本质是给定query，匹配doc；推荐的本质是给定user，推荐item。对于搜索来说，搜索引擎的本质是对于用户给定query，搜索引擎通过querydoc的match匹配，返回用户最可能点击的文档的过程。从某种意义上来说，query代表的是一类用户，就是对于给定的query，搜索引擎要解决的就是query和doc的match，如图1.1所示。对于推荐来说，推荐系统就是系统根据用户的属性（如性别、年龄、学历等），用户在系统里过去的行为（例如浏览、点击、搜索、收藏等），以及当前上下文环境（如网络、手机设备等），从而给用户推...

#搜索推荐

READ

重排

Search&Rec

2026-01-11

精排是用pointwise方式对商品的CTR/CVR进行预估，旨在建模s=f(user, query, item, context) ，对候选商品进行打分。但有些情况下仅有精排还存在不足之处，如： 1、即使对单个商品进行打分，资源效率限制下，上千候选的精排有时也无法落地更加复杂的模型； 2、pointwise模式的打分无法从候选列表整体或上下文实时反馈角度出发进行排序； 3、直接使用精排分排序无法满足特殊整体性排序需求，如常见的搜索结果的多样性（如价格、地域、品牌、风格等属性的打散）、发现性、异质内容的混排调控（如商品、内容、广告等物料的混排）、流量调控等。相应地，从以上三点出发，本文从“更加精准打分”、“关注序和上下文”、“特殊需求重排”三方面梳理重排的一般方法：更加精准打分重排的第...

#搜索推荐

READ

搜索-特征工程

Search&Rec

2026-01-11

讨论一下推荐系统三板斧：数据、特征和模型，因为搜索的排序套路和推荐十分类似，除了多了query维度特征，对相关性有一定的要求，其他很大程度上思想一致。这里先行引用一个比较形象的推荐系统优化流程： 1. 明确业务目标 1. 将业务目标转化为机器学习可优化目标 1. 样本收集 1. 特征工程 1. 模型选择和训练 1. 离线评测验证 1. 在线AB验证 1. 通过离线验证和在线AB的结果反馈到2，形成一个增强回路慢慢起飞。而在一般情况下，各个环节的贡献占比：样本特征工程模型。另外如果离线验证集85分，线上很多时候也会略低，各种原因也不胜枚举：特征延迟、特征不一致、甚至在样本落盘时的数据丢失等等。本篇先行介绍上述过程特征工程的一般方法，包括特征设计、清洗、变换以及特征选择，并在最后讨论深度学...

#搜索推荐

READ

CTR预估及DeepFM

Search&Rec

2026-01-11

CTR预测问题简介点击率(Click Through Rate, CTR)预估是程序化广告里的一个最基本而又最重要的问题。比如在竞价广告里，排序的依据就是 𝑐𝑡𝑟×𝑏𝑖𝑑 。通过选择 𝑐𝑡𝑟×𝑏𝑖𝑑 最大的广告就能最大化平台的eCPM。从机器学习的角度来说这是一个普通的回归问题，但是它的特殊性在于训练数据只有0/1的值——因为我们没有办法给同一个用户展示同一个广告1万次，然后统计点击的次数来估计真实的点击率。另外有人也许会有这样的看法：对于某一个特定的曝光，某个用户是否点击某个广告是确定的，第一次不点，第二次也不会点，因此点击率是一个0/1的固定值而不是一个01之间的概率值。这个说法有一些道理，原因是第二次实验和第一次使用不是独立同分布的。“真正”的做法是第二次做实验前要擦除用户第一次实验...

#搜索推荐

READ

FM及其变体

Search&Rec

2026-01-11

FM：Factorization Machines, 2010 —— 隐向量学习提升模型表达参考 Untitled 优势：可以有效处理稀疏场景下的特征学习具有线性时间复杂度对训练集中未出现的交叉特征信息也可进行泛化不足： 2way的FM仅枚举了所有特征的二阶交叉信息，没有考虑高阶特征的信息 2way的FM仅枚举了所有特征的二阶交叉信息，没有考虑高阶特征的信息 FFM（Fieldaware Factorization Machine）是Yuchin Juan等人在2015年的比赛中提出的一种对FM改进算法，主要是引入了field概念，即认为每个feature对于不同field的交叉都有不同的特征表达。FFM相比于FM的计算时间复杂度更高，但同时也提高了本身模型的表达能力。FM也可以看...

#搜索推荐

READ

Consistency Models

Generative Model

2026-01-11

Diffusion Models from SDE 连续扩散模型 (Continuous Diffusion Models) 将传统的离散时间扩散过程扩展到连续时间域,可以被视为一个随机过程，使用随机微分方程(SDE)来描述。其前向过程可以写成如下形式： [公式] 其中， f(x,t) 可以看成偏移系数， g(t) 可以看成是扩散系数， dw 是标准布朗运动。这个SDE 描述了数据在连续时间域内如何被噪声逐渐破坏。这个随机过程的逆向过程存在（更准确的描述：下面的逆向时间SDE具有与正向过程SDE相同的联合分布）为 [公式] 前面我们得到了扩散过程的逆向过程可以用一个SDE描述(逆向随机过程),事实上，存在一个确定性过程 (用ODE描述)也是它的逆向过程 (更准确的描述：这个ODE过程的在任...

#ODE #diffusion #Generating Model #SDE

READ

ANN (Approximate Nearest Neighbor)

Search&Rec

2026-01-11

1. 概述新闻推荐系统从海量新闻中推荐出你感兴趣的新闻，百度从海量的搜索结果中找到最优的结果，短视频推荐出你每天都停不下来的视频流，这些里面都包含ANN方法。当然，在现在的检索系统中，往往是多分支并行触发的效果，虽然DNN 大行其道，但是 ANN 一直不可或缺。通用理解上，ANN（Approximate Nearest Neighbor）是在向量空间中搜索向量最近邻的优化问题。目前业界常用nmslib、Annoy算法作为实现。在实际的工程应用中，ANN是作为一种向量检索技术应用，用于解决长尾Query召回问题。将一个资讯的ANN 召回系统抽象出来大概是下面的样子。 Ann（approximate nearest neighbor）是指一系列用于解决最近邻查找问题的近似算法。最近邻查找问题...

#搜索推荐

READ

#

!

INCOMING TRANSMISSION

SigLIP系列

BLIP系列：统一理解和生成的自举多模态模型

CLIP

EDM

Query推荐

搜索中的深度匹配模型

重排

搜索-特征工程

CTR预估及DeepFM

FM及其变体

Consistency Models

ANN (Approximate Nearest Neighbor)