- 月流量
- 0
- 产品收费
- 免费和付费
- 收录时间
- 2026-08-13
- 更新时间
- 2026-08-13
01PixelRAG是什么
PixelRAG 是伯克利 SkyLab/BAIR 开源的视觉原生 RAG 框架。框架跳出网页抽成纯文本再检索的传统路线,改用浏览器把网页、PDF 渲染成截图瓦片,通过 LoRA 微调的 Qwen3-VL 视觉向量检索,让模型直接读图上的表格、图表和版式,解决传统 RAG 丢表格、丢版式的痛点。
02PixelRAG的主要功能
页面渲染(pixelshot):用无头 Chromium把网页、PDF 渲染成截图瓦片,完整保留表格、图表、版式;Windows/macOS 自动调用系统 Chrome,支持 URL 与本地文件混用。
视觉语义检索:将截图编码为向量,支持文本搜图、以图搜图;本地默认 FAISS,大规模可切换 Qdrant(支持量化压缩、磁盘存储、多服务共享)。
像素直接阅读:检索命中的截图直接作为图像输入喂给 VLM 回答问题,全程无文本转换。
托管搜索服务:免密钥 API+ 网页 Demo,内置 828 万维基百科页预建索引,开箱即搜。
自建索引管线:pixelrag index / embed / build-index / serve 全套命令,可对自己的 PDF、站点建库,Mac(Apple Silicon)即可跑小规模。
Agent 集成:Claude Code 插件 pixelbrowse,无 MCP 依赖,让 Claude 截图”看”网页而非吞残缺 HTML。
03PixelRAG的技术原理
微信关注回复“开源”,加入AI开源项目交流群
表示层——文档即图像:用无头 Chromium 把网页截图、把 PDF 按页转图并切分为瓦片,使表格行列对齐、图表、信息图等视觉结构原样保留。
检索层——视觉向量嵌入:基于 Qwen3-VL-Embedding-2B,用对比学习数据做 LoRA 微调,让截图可被语义检索,查询命中的是”那一块图”而非”那一段字”;向量本地存 FAISS,大规模可切 Qdrant。
生成层——VLM 读图作答:检索命中的截图瓦片直接作为像素输入交给视觉语言模型,模型从图上直接读数字和版式,全程无中间文本转换。
规模与效率:首个用截图形式覆盖全量维基百科的 RAG 管线;像素表示还带来新的效率杠杆——降低截图分辨率可使 token 成本最多降 3 倍且精度不降,实验上全面超越文本 RAG 基线,最高提升 18.1%。
04如何使用PixelRAG
安装:执行 pip install pixelrag 即可获得核心工具(需 Python 3.10+)。
渲染页面:运行 pixelshot https://example.com -o ./tiles 将网页或 PDF 渲染为截图瓦片。
体验托管搜索:无需任何配置,直接 POST 请求 https://api.pixelrag.ai/search 即可搜索 828 万维基页索引,或在浏览器打开 pixelrag.ai 在线试用。
自建索引:编写 pixelrag.yaml 配置(指定文档路径、嵌入模型、输出目录),执行 pixelrag index build 构建后,用 pixelrag serve --index-dir ./my_index --port 30001 启动搜索服务(Mac Apple Silicon 即可跑小规模,全量维基索引约 217GB 需 GPU 算力)。
对接 Claude Code:执行 uv tool install pixelrag 后安装 pixelbrowse 插件(claude plugin marketplace add StarTrail-org/PixelRAG 并 claude plugin install pixelbrowse@pixelrag-plugins),即可让 Claude 截图”看”网页,无需 MCP。
进阶训练:如需自研嵌入模型,进入 train/ 目录(独立 uv 项目)按 README 微调,或直接复用官方开源的 LoRA 权重与训练数据。
05PixelRAG的核心优势
信息无损:以截图代替文本抽取,表格行列、图表、版式完整保留,彻底解决传统 RAG看起来有答案、抽完字就没了的痛点。
性能更强:论文显示其全面超越文本 RAG 基线,在 NQ、SimpleQA 等纯文本任务上同样更优,多模态与 Agentic 基准最高提升 18.1%。
成本更低:像素表示带来独有的效率杠杆,降低截图分辨率可使 token 成本最多降 3 倍且精度不降。
管线更简单:省去复杂的 HTML 解析、清洗、切分流程,渲染截图即可入库,工程量大幅缩减。
规模已验证:是首个用截图形式覆盖全量维基百科的 RAG 管线,附带 828 万页的免密钥托管索引可即刻体验。
06PixelRAG的项目地址
项目官网:https://pixelrag.ai/
GitHub仓库:https://github.com/StarTrail-org/PixelRAG
arXiv技术论文:https://arxiv.org/pdf/2606.28344
07PixelRAG的应用场景
财报与数据表问答:直接读取财报页、统计表中的数字,避免文本解析导致的行列错位。
仪表盘与图表检索:检索命中包含图表、KPI 面板的截图区域,让模型读图作答。
信息图与带图解文档:信息图、流程图等传统文本索引无法覆盖的内容可被搜索。
多栏排版产品页:复杂版式的商品对比页、新闻页保持原始布局参与检索。
Agent 网页阅读:通过 Claude Code 的 pixelbrowse 插件,让 Agent 截图”看”网页而非吞残缺 HTML。
© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。


用户评价0