AI News · AI落地案例

知衣科技用阿里云 MaxCompute 向量检索重构跨境选品匹配:CPU 消耗降约73%、内存降约93%

知衣科技是一家面向服装产业链的时尚数据 AI 平台,累计服务近万家客户。在为跨境电商商家做选品服务时,需把商品图与海外社媒达人内容做全量匹配,但单轮检索要完成商品侧约 1000 万条与社媒侧约 200 万条 512 维向量的交叉匹配,算力压力巨大、成本高。

知衣科技用阿里云 MaxCompute 向量检索重构跨境选品匹配:CPU 消耗降约73%、内存降约93%
AI辅助整理:本文基于下方列出的公开原始来源改写,不代替原文。

核心摘要: 知衣科技是一家面向服装产业链的时尚数据 AI 平台,累计服务近万家客户。在为跨境电商商家做选品服务时,需把商品图与海外社媒达人内容做全量匹配,但单轮检索要完成商品侧约 1000 万条与社媒侧约 200 万条 512 维向量的交叉匹配,算力压力巨大、成本高。知衣与阿里云合作,确立“自研模型负责理解、MaxCompute 负责检索”的分工,两周完成切换,CPU 消耗降约 73%、内存消耗降约 93%。

业务背景

知衣科技是面向服装产业链的时尚数据 AI 平台,围绕趋势发现、爆款挖掘与内容营销等场景,为服装企业提供全链路数智化方案,累计服务客户近万家,旗下有知衣、知款、抖衣、海外探款等 SaaS 与 AI 应用。其业务覆盖海内外,跨境选品是核心场景之一。

业务问题

在面向跨境电商商家的服务中,知衣需要把商品图与海外社媒达人内容做全量匹配,以商品与达人内容的关联结果支撑选品决策。规模化落地面临两个难点:一是达人发布的是场景化图片,与商品图直接算相似度易受人物、背景等非主体元素干扰,需先对两侧图片分别做服装区域检测并裁剪主体。

二是算力压力大,单轮检索要把商品侧约 1000 万条 512 维向量与社媒侧约 200 万条查询向量全量交叉匹配,原方案在算力与成本上难以支撑高频全量重跑,迫使团队在内容池规模、数据新鲜度与成本之间取舍。

AI 如何落地

知衣与阿里云大数据 AI 平台合作,确立“自研模型负责理解、MaxCompute 负责检索”的技术分工:保留知衣自研 CV 模型做服装识别与特征提取,运行在自有 GPU 集群。

把原本基于 Proxima 的检索方案替换为 MaxCompute 提供的离线向量检索能力。向量数据直接写入 MaxCompute,用标准 VECTOR_SEARCH SQL 函数完成批量相似度匹配,索引由系统自动构建维护,从而去掉独立的向量检索基础设施。

实施步骤

流程大致分四步:先对海外社媒公开博文集中清洗,并对社媒图与商品图分别做服装区域检测、裁出主体商品以排除干扰。

再由知衣自研 CV 模型完成打标与特征向量提取,模型仍自主训练、自主部署。

随后把向量数据迁移进 MaxCompute 并启用其离线向量检索。

最后通过标准 VECTOR_SEARCH SQL 做批量匹配,索引交给平台自动维护。据来源,整个切换从验证到生产上线约两周完成。

结果证据与边界

来源披露的数据包括:在相同检索规模下,以 Proxima 最近 14 次运行均值为基准,MaxCompute 离线向量检索使 CPU 消耗下降约 73%、内存消耗下降约 93%;切换耗时约两周;独立向量检索基础设施不再需要维护,算法团队能把精力集中到服装特征提取能力上。

需要说明的边界是:来源表示检索成本下降使商家可在相同预算下覆盖更大内容池、以更高频率重跑全量匹配,但关于业务收入或选品收益的具体量化结果来源未披露。

可复制动作

可复制动作包括:将模型理解能力与大规模向量检索分层,避免为检索重建整套设施;优先选用平台内置、可 SQL 调用的向量检索能力以降低运维;在提特征前先做图像主体裁剪以提升匹配质量;自研模型保留自有训练与部署环境,只迁移检索环节以守住核心资产;用对比基线(如最近 14 次运行均值)先验证成本收益再切换生产。

证据与边界

  • 来源为阿里云官方客户案例库。
  • CPU 消耗下降约 73%、内存消耗下降约 93%,以 Proxima 最近 14 次运行均值为基准。
  • 从验证到生产上线约两周完成切换。
  • 业务收入增长的具体数值来源未披露。

企业今天可以做什么

可复制动作包括:把“模型能力”与“大规模检索”拆开分工,避免为了检索重建整套基础设施;用标准 SQL 化的向量检索函数承接批量匹配,让平台自动构建维护索引以降低运维负担;先对商品图与社媒图分别做服装区域检测、裁剪出主体后再提特征,减少背景与配饰干扰;自研模型资产保留在自有 GPU 集群,只把检索迁移到数据平台,最大限度守住技术积累;先在验证环境做成本对比、再切换生产,降低迁移风险。

资料来源

公众号原题:阿里云客户案例:知衣科技基于MaxCompute向量检索,千万级匹配资源消耗降70%+ · 查看公众号原文

你的企业,AI最该先改哪一段?

带着一个真实业务问题,先做一次增长诊断。

获取增长诊断