AI辅助整理:本文基于下方列出的公开原始来源改写,不代替原文。
核心摘要: AWS宣布TwelveLabs的Marengo Embed 3.0作为嵌入模型在Amazon Bedrock知识库中正式可用。该模型把视频、音频、图片与文本联合编码进512维向量空间,配合托管知识库自动完成分段、抽帧、转写、嵌入与检索,用户无需自建转写、抽帧、向量库与同步逻辑。官方给出的示例是对2022年世界杯决赛10分钟片段做自然语言检索,例如“找出这场比赛的点球”。目前在美国东部(弗吉尼亚北部)与美国西部(加利福尼亚北部)两个区域可用。
业务背景:视频与图片长期“不可按含义检索”
官方在发布中指出,视频与媒体资产在很大程度上仍无法按含义检索。媒体、体育分析、教育、安防与零售团队需要在数小时素材中找到特定时刻,例如“给我看下半场的点球”。
过去要自建语义检索,需要把转写服务、抽帧流水线、嵌入模型、向量数据库与同步逻辑拼在一起,工程复杂且维护成本高。
产品更新了什么
Amazon Bedrock知识库是托管的检索增强生成服务,负责存储、摄取、嵌入、重排与检索,支持MP4、MOV视频、JPEG、PNG图片与音轨,并内置S3、SharePoint、Confluence等连接器。
Marengo Embed 3.0是多模态嵌入模型,把视频、音频、图片与文本联合编码进紧凑的512维向量空间。接入后,用自然语言搜索视频、音频与图片内容成为完全托管的体验,托管知识库会自动生成多模态嵌入,把视觉、文本、语音与音频信号统一到同一向量表示。
AI怎么落地:五步走通
第一步,准备素材:把视频文件上传到S3,无需预处理,托管知识库会自行完成分段、抽帧与转写。
第二步,创建托管知识库:在Bedrock控制台选择创建托管知识库,在嵌入模型处把默认的Amazon Titan Text改为TwelveLabs/Marengo Embed 3.0,数据源选择S3并填写桶路径。
第三步,同步摄取:点击同步后,系统自动抽帧、转写音频、为每个分段生成嵌入并写入索引。第四步,语义检索:在控制台测试区输入如“找出这场比赛的点球”的查询,返回结果带分段起止时间、来源URI与嵌入类型等元数据。第五步,接入应用:通过Bedrock Retrieve API或作为AgentCore的网关目标供下游应用调用。
结果证据与边界
官方示例使用2022年世界杯决赛的10分钟片段,检索“点球”时返回的靠前结果定位到点球发生的时刻,并附带可回放的视频与来源分段时间线。
边界方面:目前仅在美国东部(弗吉尼亚北部)与美国西部(加利福尼亚北部)可用;音频与视频分段默认均为4秒,可在高级配置中调整;嵌入生成按Amazon Bedrock标准模型调用费率计费,托管知识库按存储与检索计费。来源未披露客户侧量化收益。
可复制动作
先做资产盘点,把视频与图片集中到S3或已支持的连接器数据源,明确哪些素材值得被检索。
用三个真实业务问题做验收,例如“找出讲某功能的那段演示”“找出客户提到某问题的通话片段”,确认返回结果的时间戳与来源可核对。
根据检索精度与成本调整分段时长,并把检索接口接入现有客服、培训或营销系统,避免只停留在控制台演示。
证据与边界
- 官方宣布Marengo Embed 3.0在Amazon Bedrock知识库正式可用
- 模型把视频、音频、图片与文本联合编码为512维向量
- 可用区域为us-east-1与us-west-1
- 发布日期来自页面元数据2026-09-10
企业今天可以做什么
建议内容与营销团队先做一次资产盘点:把散落在S3、SharePoint或Confluence的视频与图片接入托管知识库,用Marengo 3.0生成嵌入后,先跑三个高频检索问题验证效果,例如“找出讲某功能的那段演示”“找出客户提到某问题的通话片段”。同时注意两点:一是当前仅两个美国区域可用,需确认数据驻留要求;二是分段时长默认4秒,可按业务调整以平衡检索精度与成本。