AI辅助整理:本文基于下方列出的公开原始来源改写,不代替原文。
核心摘要: 知衣科技是一家面向服装产业链的时尚数据 AI 平台,累计服务近万家客户。在为跨境电商商家做选品服务时,需把商品图与海外社媒达人内容做全量匹配,但单轮检索要完成商品侧约 1000 万条与社媒侧约 200 万条 512 维向量的交叉匹配,算力压力巨大、成本高。知衣与阿里云合作,确立“自研模型负责理解、MaxCompute 负责检索”的分工,两周完成切换,CPU 消耗降约 73%、内存消耗降约 93%。
业务背景
知衣科技是面向服装产业链的时尚数据 AI 平台,围绕趋势发现、爆款挖掘与内容营销等场景,为服装企业提供全链路数智化方案,累计服务客户近万家,旗下有知衣、知款、抖衣、海外探款等 SaaS 与 AI 应用。其业务覆盖海内外,跨境选品是核心场景之一。
业务问题
在面向跨境电商商家的服务中,知衣需要把商品图与海外社媒达人内容做全量匹配,以商品与达人内容的关联结果支撑选品决策。规模化落地面临两个难点:一是达人发布的是场景化图片,与商品图直接算相似度易受人物、背景等非主体元素干扰,需先对两侧图片分别做服装区域检测并裁剪主体。
二是算力压力大,单轮检索要把商品侧约 1000 万条 512 维向量与社媒侧约 200 万条查询向量全量交叉匹配,原方案在算力与成本上难以支撑高频全量重跑,迫使团队在内容池规模、数据新鲜度与成本之间取舍。
AI 如何落地
知衣与阿里云大数据 AI 平台合作,确立“自研模型负责理解、MaxCompute 负责检索”的技术分工:保留知衣自研 CV 模型做服装识别与特征提取,运行在自有 GPU 集群。
把原本基于 Proxima 的检索方案替换为 MaxCompute 提供的离线向量检索能力。向量数据直接写入 MaxCompute,用标准 VECTOR_SEARCH SQL 函数完成批量相似度匹配,索引由系统自动构建维护,从而去掉独立的向量检索基础设施。
实施步骤
流程大致分四步:先对海外社媒公开博文集中清洗,并对社媒图与商品图分别做服装区域检测、裁出主体商品以排除干扰。
再由知衣自研 CV 模型完成打标与特征向量提取,模型仍自主训练、自主部署。
随后把向量数据迁移进 MaxCompute 并启用其离线向量检索。
最后通过标准 VECTOR_SEARCH SQL 做批量匹配,索引交给平台自动维护。据来源,整个切换从验证到生产上线约两周完成。
结果证据与边界
来源披露的数据包括:在相同检索规模下,以 Proxima 最近 14 次运行均值为基准,MaxCompute 离线向量检索使 CPU 消耗下降约 73%、内存消耗下降约 93%;切换耗时约两周;独立向量检索基础设施不再需要维护,算法团队能把精力集中到服装特征提取能力上。
需要说明的边界是:来源表示检索成本下降使商家可在相同预算下覆盖更大内容池、以更高频率重跑全量匹配,但关于业务收入或选品收益的具体量化结果来源未披露。
可复制动作
可复制动作包括:将模型理解能力与大规模向量检索分层,避免为检索重建整套设施;优先选用平台内置、可 SQL 调用的向量检索能力以降低运维;在提特征前先做图像主体裁剪以提升匹配质量;自研模型保留自有训练与部署环境,只迁移检索环节以守住核心资产;用对比基线(如最近 14 次运行均值)先验证成本收益再切换生产。
证据与边界
- 来源为阿里云官方客户案例库。
- CPU 消耗下降约 73%、内存消耗下降约 93%,以 Proxima 最近 14 次运行均值为基准。
- 从验证到生产上线约两周完成切换。
- 业务收入增长的具体数值来源未披露。
企业今天可以做什么
可复制动作包括:把“模型能力”与“大规模检索”拆开分工,避免为了检索重建整套基础设施;用标准 SQL 化的向量检索函数承接批量匹配,让平台自动构建维护索引以降低运维负担;先对商品图与社媒图分别做服装区域检测、裁剪出主体后再提特征,减少背景与配饰干扰;自研模型资产保留在自有 GPU 集群,只把检索迁移到数据平台,最大限度守住技术积累;先在验证环境做成本对比、再切换生产,降低迁移风险。