机器人排除协议、AI 网页访问与浏览器新闻摘要

浏览器里的 AI 摘要,究竟替你改写了多少新闻?

机器人排除协议、AI 网页访问与浏览器新闻摘要
Photo by Artists Eyes / Unsplash
📑
本期前沿速递分享了两篇论文。

你让 AI 帮忙读一个网页时,表面上看到的只是几句回答。可在回答出现之前,系统可能已经去访问了网页、读取了内容,也可能被网站规则挡在门外。第一篇论文关心的正是这个后台过程:主流 AI 助手在实时检索网页时,会不会尊重网站设置的访问边界呢?

第二篇论文更贴近日常。现在不少浏览器会直接替新闻生成摘要,读者还没进入全文,已经先看到一版被压缩过的内容。作者审计了 15 家美国媒体的政治新闻,比较 13777 篇文章和 41331 条摘要,讨论浏览器作为编辑中介会怎样改动新闻抵达读者的方式?

祝今日读写愉悦,洞见深省。

前沿速递

生成式人工智能助手是否遵守 robots.txt?追踪可见回答背后的网页访问行为

核心概念

检索增强生成(Retrieval-augmented generation,简称 RAG):这指的是一种将大语言模型内部的参数化知识与外部非参数化数据源相结合的人工智能系统架构。在模型处理用户查询的推理阶段,该系统会实时检索外部数据库、本地文档或互联网网页,将检索到的相关信息作为上下文补充到输入提示中,并由大语言模型融合这些实时获取的上下文来生成最终回答。这种机制常用于解决语言模型事实性不足、无法提供最新信息以及产生幻觉的问题。

机器人排除协议(Robots exclusion protocol,简称 REP):这指的是一种互联网网站所有者用于向网络机器人和其它自动化代理表达网页抓取和准入限制的机器可读标准协议。该协议主要通过在网站根目录下部署名为 robots.txt 的文本文件来实现,文件中包含一系列针对特定或全部用户代理的允许或禁止访问路径规则。合规的自动化客户端在发起资源请求前,应当主动获取并解析该文件,自觉遵守其中规定的爬取边界,但该协议本身不具备强制拦截访问的物理防御能力。

研究问题

现有的生成式 AI 越来越多地在推理阶段通过检索增强生成获取网页内容,以提供最新的、有根据的回答。然而,既有研究大多聚焦于这些系统执行网页浏览任务的成功率或信息检索的准确性,忽略了这些系统在后台检索网页时是否遵守了网站所有者设置的准入规则。特别是对于通过机器人排除协议表达的被动访问限制,目前缺乏系统、受控的实证评估。这导致网站运营者无法确知其机器可读的版权声明和准入控制是否在人工智能助手的实际运行中得到了尊重。

因此,这篇论文的研究问题是:第一,主流的生成式人工智能助手在用户主动请求检索特定网页时,是否能够实现可观测的实时网页检索?第二,这些系统在进行实时网页检索时,是否遵守了通过机器人排除协议所建立的 robots.txt 访问限制规则?第三,这些系统的服务器端实际网页检索行为与给用户呈现的最终回答准确性之间存在怎样的关系?