Reddit 正在起訴 Perplexity 和三個“數據抓取服務提供商”,以“阻止一群不良行為者,他們不採取任何行動,以工業規模獲取 Reddit 上有價值的受版權保護的內容,非法規避數據保護。” 根據投訴。
該公司將數據抓取公司 SerpApi、Oxylabs 和 AWMProxy 比作“銀行劫匪”,他們“知道自己無法闖入銀行金庫,而是闖入一輛運載現金的運鈔車”。 Reddit 聲稱 Perplexity 是“至少一家”數據抓取公司的客戶,該公司“會不擇手段地獲取其迫切需要的 Reddit 數據,以為其‘答案引擎’提供動力——這意味著任何事情 而不是 正如一些競爭對手所做的那樣,直接與 Reddit 簽訂合同。 ”
根據訴訟,Reddit 於 2024 年 5 月向 Perplexity 發送了一封停止函,“要求其停止抓取 Reddit 數據”。儘管 Perplexity 當時告訴 Reddit,它沒有使用 Reddit 內容來訓練 AI 模型,並且尊重 Reddit 的 robots.txt,但在那封信之後,Reddit 對 Perplexity 的引用量實際上有所增加。 Reddit 還創建了一個只能由 Google 抓取的帖子,並且“在幾個小時內”,Perplexity“生成了該帖子的內容”,該公司表示。
Reddit 寫道:“Perplexity 獲得 Reddit 內容並將其用於其‘答案引擎’的唯一方法是,它和/或其共同被告抓取該 Reddit 內容的 Google SERP,並且 Perplexity 迅速將該數據合併到其答案引擎中。”
Reddit 首席法律官本·李 (Ben Lee) 在一份聲明中表示:“人工智能公司已經捲入了一場爭奪高質量人類內容的軍備競賽,這種壓力助長了工業規模的‘數據洗錢’經濟。” “爬蟲繞過技術防禦竊取數據,然後將其出售給渴望培訓材料的客戶。Reddit 是主要目標,因為它是有史以來最大、最動態的人類對話集合之一。
“被告 Oxylabs UAB、AWM Proxy 和 SerpAI(一家立陶宛數據抓取工具、前俄羅斯殭屍網絡以及一家公開宣傳其不正當規避策略的公司)是這種非法行為的典型例子,”Lee 說。 “Reddit 無法直接被抓取,他們會掩蓋自己的身份,隱藏自己的位置,並偽裝自己的網絡抓取工具,以從 Google 搜索中竊取 Reddit 內容。令人困惑的是,如果客戶寧願購買被盜數據,也不願與 Reddit 簽訂法律合同,那麼他們至少會更喜歡其中一個抓取工具。”
Perplexity 公關主管傑西·德懷爾 (Jesse Dwyer) 表示:“Perplexity 尚未收到訴訟,但我們將始終為消費者自由、公平獲取公共知識的權利而奮鬥。” 邊緣。 “我們的做法是有原則和負責任的,因為我們通過準確的人工智能提供真實的答案,我們不會容忍對開放性和公共利益的威脅。”









