每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AWS公开利用Bedrock AgentCore构建网页洞察自动提取的方法

结合AgentCore Browser、OpenSearch与Lambda,实现从RSS监测到语义搜索的全流程自动化

이미지: METAL LAB 생성

摘要

  • AWS公开了一套结合Amazon Bedrock AgentCore Browser、Bedrock、OpenSearch Serverless与Lambda的网页洞察自动提取方案
  • 该方案采用事件驱动架构,由EventBridge每15分钟检查一次RSS订阅源,筛选出新文章后通过浏览器会话采集内容
  • 据介绍,AgentCore Browser能够稳定渲染基于JavaScript的页面,即便网站改版,流水线也不易因此中断
발행처
AWS Machine Learning Blog
작성자
Louisa Liu
발행일
2026-08-04
핵심 구성 요소
Amazon Bedrock AgentCore Browser, Amazon Bedrock, Amazon OpenSearch Serverless, AWS Lambda, Amazon EventBridge, Amazon S3
수집 주기
EventBridge 스케줄로 15분마다 RSS 피드 확인
브라우저 연결 방식
Playwright를 Chrome DevTools Protocol(CDP)로 연동
코드 공개 여부
GitHub 저장소에 전체 구현 공개

AWS通过其机器学习博客介绍了如何利用Amazon Bedrock AgentCore构建网页洞察自动提取方案。其目标是将过去需要逐一查看数十个网站、手动收集竞争对手动态或市场信息的工作实现自动化。

事件驱动的流水线架构

该方案采用将内容采集与AI处理分离的事件驱动架构。Amazon EventBridge调度每15分钟触发一次Lambda函数,检查已注册RSS订阅源中的新文章,并与存储在Amazon S3中的既有数据进行比对以去除重复内容。

一旦发现新文章,Lambda函数便会通过Amazon Bedrock AgentCore打开浏览器会话,利用Chrome DevTools Protocol(CDP)连接Playwright来获取页面。与普通的HTTP请求不同,远程浏览器会完整渲染基于JavaScript的内容,等待动态元素加载完成后再截图并下载图片。AWS指出,如果没有稳定的页面渲染,后续的AI提取环节就会接收到不完整的内容。

采集到的结果以结构化形式上传至S3,随后由Amazon S3事件触发后续处理流程。提取出的洞察信息随后通过Amazon OpenSearch Serverless的向量嵌入实现基于语义的搜索。

可适用的应用场景

AWS表示,该架构可应用于追踪竞品与价格变动的竞争情报分析、监测行业新闻与新兴技术的市场调研、整合多来源内容的内容策展,以及监控监管类网站变化的合规监测等场景。据介绍,完整实现代码已在GitHub仓库中公开。