This is the Trace Id: a6df6d5e784b556a8f7e90f8f09c1fc7
跳转至主内容 浏览 查看所有产品 (200+) Microsoft Foundry Azure Copilot GitHub Copilot Azure Kubernetes 服务 (AKS) Azure Cosmos DB Azure Database for PostgreSQL Azure Arc Microsoft Fabric Azure 上的 Linux 虚拟机 Foundry 模型 Foundry 智能体服务 Foundry IQ Foundry Tools Foundry Control Plane Foundry Control Plane 中的可观测性 Foundry 模型中的 Azure OpenAI Foundry Tools 中的 Azure 语音 Azure 机器学习 查看所有数据库 Azure Cosmos DB Azure DocumentDB Azure SQL Azure Database for PostgreSQL Azure 托管的 Redis Microsoft Fabric Azure Databricks Azure 上的 Linux 虚拟机 Azure 上的 Windows Server Azure Functions Azure 虚拟机规模集 Azure API 管理 Azure 容器应用 Azure Kubernetes 服务 (AKS) Azure Kubernetes 舰队管理器 Azure 容器注册表 Azure Red Hat OpenShift Azure 容器实例 Azure 容器存储 Azure Arc Azure Local Microsoft Defender for Cloud Azure Monitor Microsoft Sentinel Azure Migrate 查看所有解决方案 (40+) 适用于中小型企业的云解决方案 云迁移和现代化中心 AI 数据分析 Azure 数据库 AI 应用和智能体 Microsoft 市场 Microsoft Sovereign Cloud AI 应用和智能体 Azure 的负责任 AI AI 基础结构 AI 数据分析 机器学习运营 (MLOps) Azure 上的低代码应用程序开发 集成服务 无服务器计算 DevOps 迁移和现代化中心 .NET 应用迁移 Azure 上的数据库 Linux on Azure Azure 上的 Oracle Microsoft 云上的 SAP 自适应云 高性能计算 (HPC) 基础结构即服务 (IaaS) 复原能力 Azure Essentials 适用于 Azure 的 Frontier Accelerate Azure 上的 FinOps Microsoft 市场 Azure 定价概述 创建 Azure 帐户 免费 Azure 服务 灵活的购买选项 定价计算器 Azure 上的 FinOps 最大限度地提高 AI 的 ROI Azure 节省计划 Azure 预留 Azure 混合权益 虚拟机 Azure SQL Microsoft Foundry Microsoft Fabric Azure Kubernetes 服务 (AKS) Microsoft Defender for Cloud 查看更多 软件开发公司 Microsoft 市场 寻找合作伙伴 面向 Azure 合作伙伴的资源 开始使用 Azure 客户案例 分析师报告、白皮书和电子书 视频 详细了解云计算 文件 探索 Azure 门户 开发人员资源 快速启动模板 面向初创企业的资源 开发者社区 学生 面向合作伙伴的 Azure 部落格 活动与网络研讨会 了解 支援 连络销售人员 开始使用 Azure 登录

什么是向量数据库? 

向量数据库以数值向量形式存储和搜索文本、图像、音频及其他数据。 它对 AI 应用程序和现代数据体系结构至关重要。 

向量数据库的定义

向量数据库是专门以数值向量(也称为嵌入)形式存储和搜索数据的系统。嵌入是文本、图像、音频或其他非结构化数据的数值表示形式。与依赖精确关键字匹配的传统数据库不同,向量数据库基于语义相似性检索结果。向量数据库可实现快速相似度检索,因此是生成式 AI 应用程序和现代数据体系结构的必备组件。

  • 向量数据库以数值表示形式(也称为嵌入)存储数据,用于基于相似度的检索。
  • 与传统数据库不同,向量数据库可以处理非结构化数据和高维度查询。
  • 它具备多项有价值的优势,包括高速相似度搜索、数据语义理解以及更好的用户体验。 
  • 向量数据库可应用于语义搜索、推荐、检索增强生成 (RAG) 以及图像和视频搜索。
  • 未来发展趋势包括混合搜索,以及与企业数据系统更深度的集成。

向量数据库详解 

向量数据库以高维向量形式组织数据,而非采用行、列结构。这种设计支持语义搜索和检索,使向量数据库成为需要上下文响应的应用程序的基础。  随着越来越多组织采用生成式 AI 和 大语言模型 (LLM),这些数据库为RAG、推荐系统和智能搜索奠定了基础。      

工作原理

向量数据库将数据存储为可捕捉语义含义的数值向量。它不依赖精确关键字匹配,而是使用相似性搜索技术来检索在向量空间中最接近的项。    

例如,像“如何重置我的密码”这样的短语会被转换为向量嵌入。当用户搜索“密码帮助”、“需要重置密码”或其他类似内容时,系统会检索语义最接近的向量,即使词语不同。       

这种方法可以为聊天机器人、推荐引擎和知识发现工具等 AI 支持的应用程序提供提供低延迟的高速检索能力。      

了解向量数据库与传统数据库之间的差异

向量数据库与传统数据库的核心用途截然不同,尽管二者均在现代数据生态体系中发挥作用。理解这些差异很重要,有助于组织根据业务负载选择合适的工具。            

传统数据库的工作方式

关系数据库管理系统 (RDBMS) 等传统数据库以行和列的形式存储结构化数据。这类数据库经过优化,适用于新增、更新,以及依赖精准匹配或预定义关系的查询等事务操作。      

但是,传统数据库难以处理文本、图像、音视频等非结构化、高维度数据;其设计初衷并不支持语义理解或基于相似度的检索。  在关系型数据库中执行关键字搜索仅能返回完全匹配内容,无法满足语义搜索、推荐引擎等应用场景的需求。

向量数据库的工作方式 

向量数据库专为 AI 业务负载打造。它不采用行和列的存储模式,而是存储嵌入,即非结构化数据的高维数值表示形式。 这些嵌入能够捕获语义含义,因此系统可以基于相似度而非精准匹配返回检索结果。    例如,查询“最适合跑步的鞋子”时,即使存储的数据使用了不同的术语,例如“运动鞋”,也会返回相关结果。  

向量数据库与 NoSQL 数据库的对比  

向量数据库与 NoSQL 数据库也存在区别。后者属于非关系数据库,用于存储和管理无法规整放入固定架构数据表的数据;向量数据库针对基于嵌入向量的相似度搜索进行了优化,NoSQL 数据库则针对通过键值或自定义查询灵活存取半结构化数据进行了优化。        

向量数据库的五大优势 

向量数据库可为组织提供独特的优势,包括:

1. 数据语义理解能力

与依赖精确关键字匹配的传统数据库不同,向量数据库基于含义和上下文检索结果。这种语义能力可以确保用户即使使用不同的措辞,也能找到相关信息。这可以提升准确性并改善用户体验。 

2. 对非结构化和多模态数据提供更强大的支持

向量数据库可以处理由文本、图像、音频和视频生成的嵌入。这种灵活性使组织能够在单一系统中管理多种数据类型,从而支持图像相似性搜索、基于语音的查询和跨模态推荐等高级用例。

3. 大规模高速相似度搜索

向量数据库针对近似最近的邻域 (ANN) 搜索进行了优化,即使在处理数十亿个向量时,也能实现低延迟检索。这对聊天机器人、推荐引擎和欺诈检测系统等实时应用至关重要。 

4. 与 AI 和机器学习工作流集成

向量数据库可与机器学习深度学习管道、语言模型以及 RAG 系统无缝集成。这可以确保 AI 应用程序访问最相关、最具上下文信息的数据,从而做出准确的预测和响应。 

5. 增强个性化和用户体验

通过使用向量数据库,组织可以提供高度个性化的推荐、搜索结果和内容建议。这有助于提升参与度、提高客户满意度,并支持零售、媒体和金融等行业的业务增长。 

除了向量数据库之外,各行业的组织还利用数据仓库数据库分片来获得更多优势。

组织如何将向量数据库用于实际工作 

向量数据库可提供传统系统无法提供的功能,尤其是在处理非结构化或高维数据时。   它们能够执行基于相似度的检索,而不是精确关键字匹配,这使它们成为现代 AI 应用不可或缺的技术。以下是组织使用这些功能强大的数据库的一些方式:  

语义搜索

 向量数据库 不依赖精确关键字匹配,而是根据含义和上下文检索结果。这对于客户支持门户、企业知识库和电子商务平台至关重要,在这些平台中,用户的查询表述往往与库内存储内容措辞不一致。  

推荐系统

由向量数据库驱动的推荐引擎会分析用户行为和偏好,以推荐相关的产品、内容或服务。流式传输平台会利用这种方法,根据观看历史推荐节目,而电商网站则通过比较购买模式的向量表示来推荐配套产品。      与基于规则的系统不同,基于向量的推荐会随着用户行为变化动态调整,从而带来更个性化的体验。

图像和视频搜索

传统搜索方法很难处理视觉内容,因为文件名和标签很少能捕获所有相关特征。 向量数据库通过存储图像和视频的嵌入来解决这一问题,使系统能够按视觉相似度匹配内容。 用户可以上传一张产品图片,系统会从目录中检索相似产品,即使元数据不同也不受影响。    此功能对零售、媒体和医疗保健等行业至关重要,因为视觉数据在这些行业中发挥核心作用。 

RAG

如果语言模型能够获取准确的领域专属信息,就能生成更好的回复。  向量数据库通过 RAG 系统实现这一效果,在模型生成答案之前,先检索相关文档并将其作为上下文提供。   例如,企业聊天机器人可以先从向量数据库中提取公司政策,再回复与人力资源相关的查询,从而确保准确性和合规性。这种方法可以减少 AI 幻觉,并提升对 AI 系统的信任。

欺诈检测

金融机构和电子商务平台使用向量数据库来检测交易模式中的异常。通过比较正常行为和可疑行为的向量表示,这些系统可以识别规则系统可能会漏掉的细微偏差。  这种主动方法有助于防止欺诈、保护客户帐户并维护法规合规性。  

向量数据库的未来 

随着越来越多的组织采用 AI 支持的应用程序,向量数据库正成为现代数据架构的核心组件。这些数据库提供了一种强大的方式来存储和快速搜索海量非结构化数据。

向量数据库未来发展趋势大概率包括:与传统数据库深度融合、更高级的混合检索能力,以及对生成式 AI 系统更深入的支持。公司希望为客户与员工提供更优质的搜索体验,向量数据库将持续在支持扩展具备上下文感知能力的应用程序方面发挥重要作用。 

常见问题解答

  • 向量数据库用于存储和搜索高维向量嵌入,以便在文本、图像或音频等非结构化数据中快速查找相似项目。  
  • 向量数据库用于存储嵌入,并使用相似度搜索处理非结构化数据;传统数据库则用于存储结构化数据,并依赖精确匹配。 
  • 向量数据库很重要,因为它们可以通过检索增强生成 (RAG) 为语言模型提供相关上下文,从而提高准确性并减少 AI 幻觉。 
  • 不,SQL 数据库不是向量数据库。 SQL 数据库是关系数据库,专为结构化数据设计,不适合存储或搜索高维向量。