Perplexity AI ถูก AWS สอบสวนปมแอบดูดข้อมูลเว็บไซต์ฝ่าฝืนกฎ robots.txt

กลายเป็นประเด็นร้อนในวงการเทคโนโลยี เมื่อ Amazon Web Services (AWS) ยักษ์ใหญ่ด้านคลาวด์คอมพิวติ้ง ได้เริ่มดำเนินการสอบสวน Perplexity AI สตาร์ทอัพด้านการค้นหาด้วย AI ที่มีมูลค่าบริษัทสูงถึง 3 พันล้านดอลลาร์ และได้รับการสนับสนุนจากกองทุนครอบครัว Jeff Bezos รวมถึง Nvidia โดยประเด็นหลักอยู่ที่ข้อสงสัยว่า Perplexity ได้ละเมิดกฎการใช้งานของ AWS ผ่านการดูดข้อมูล (Scraping) จากเว็บไซต์ที่ไม่อนุญาตให้เข้าถึง

จุดเริ่มต้นของความขัดแย้ง: การเพิกเฉยต่อมาตรฐาน robots.txt

หัวใจสำคัญของเรื่องนี้คือ Robots Exclusion Protocol หรือที่รู้จักกันในชื่อไฟล์ robots.txt ซึ่งเป็นมาตรฐานสากลของเว็บที่เจ้าของเว็บไซต์ใช้ระบุว่า หน้าใดบ้างที่ห้ามไม่ให้บอทหรือโปรแกรมอัตโนมัติเข้ามาเก็บข้อมูล แม้ว่าโปรโตคอลนี้จะไม่มีผลผูกพันทางกฎหมาย แต่โดยทั่วไปแล้วบริษัทเทคโนโลยีส่วนใหญ่จะให้ความเคารพและปฏิบัติตาม เพื่อเป็นการให้เกียรติเจ้าของเนื้อหา

อย่างไรก็ตาม Patrick Neighorn โฆษกของ AWS ยืนยันว่าลูกค้าที่ใช้บริการของ AWS จะต้องปฏิบัติตามมาตรฐาน robots.txt ในการเก็บข้อมูล และระบุชัดเจนว่าข้อตกลงการใช้งานของ AWS ไม่อนุญาตให้มีกิจกรรมที่เข้าข่ายการละเมิดหรือการใช้งานในทางที่ผิด

Image 6

หลักฐานการลักลอบเก็บข้อมูลและ IP ลึกลับ

จากการสืบสวนของ WIRED พบว่า Perplexity มีพฤติกรรมที่น่าสงสัย โดยเฉพาะการใช้ที่อยู่ IP ที่ไม่ได้เปิดเผยต่อสาธารณะ (44.221.181.252) เพื่อเข้าถึงเว็บไซต์ในเครือ Condé Nast หลายร้อยครั้งในช่วง 3 เดือนที่ผ่านมา ทั้งที่ทาง Condé Nast ได้สั่งบล็อกตัวเก็บข้อมูลของ Perplexity ผ่านไฟล์ robots.txt ไว้อย่างชัดเจน

นอกจากนี้ สำนักข่าวชั้นนำอย่าง The Guardian, Forbes และ The New York Times ต่างรายงานว่าตรวจพบ IP ดังกล่าวเข้ามาเยี่ยมชมเซิร์ฟเวอร์ของตนซ้ำๆ ซึ่งเมื่อตรวจสอบย้อนกลับพบว่า IP นี้เชื่อมโยงกับ Elastic Compute Cloud (EC2) หรือบริการเครื่องเซิร์ฟเวอร์เสมือนบนระบบคลาวด์ของ AWS นั่นเอง

Image 7

คำชี้แจงจากฝั่ง Perplexity AI

Aravind Srinivas ซีอีโอของ Perplexity ในตอนแรกปฏิเสธข้อกล่าวหาโดยระบุว่าเป็นการเข้าใจผิดเกี่ยวกับระบบการทำงานของอินเทอร์เน็ต แต่ต่อมาได้ยอมรับว่า IP ที่ถูกตรวจพบนั้นดำเนินการโดย บริษัทบุคคลที่สาม (Third-party) ที่ให้บริการดัชนีเว็บและเก็บข้อมูล ซึ่งเขาไม่สามารถเปิดเผยชื่อบริษัทได้เนื่องจากติดสัญญาไม่เปิดเผยข้อมูล (NDA)

ด้าน Sara Platnick โฆษกของบริษัท ระบุว่า PerplexityBot ของบริษัทปฏิบัติตามกฎ robots.txt และไม่ได้ละเมิดข้อตกลงของ AWS แต่ยอมรับว่ามีกรณี "ยกเว้น" คือเมื่อผู้ใช้งานระบุ URL ของเว็บไซต์ที่ต้องการลงในคำสั่ง (Prompt) โดยตรง ระบบจะเข้าไปดึงข้อมูลจาก URL นั้นทันที ซึ่งทางบริษัทมองว่าเป็นการกระทำในนามของผู้ใช้ เปรียบเสมือนการที่คนเข้าไปก๊อปปี้ข้อความมาวางในระบบด้วยตนเอง

มุมมองจากอุตสาหกรรมเนื้อหาดิจิทัล

Jason Kint ซีอีโอของ Digital Content Next สมาคมการค้าด้านเนื้อหาดิจิทัล ซึ่งรวมสมาชิกอย่าง The New York Times และ The Washington Post มองว่าหากข้อกล่าวหานี้เป็นจริง Perplexity กำลังละเมิดหลักการพื้นฐานของ AI โดยเขาย้ำว่าบริษัท AI ควรตระหนักว่าตนไม่มีสิทธิ์นำเนื้อหาของผู้ผลิตสื่อไปใช้ซ้ำโดยไม่ได้รับอนุญาต และการเลี่ยงกฎ robots.txt คือสัญญาณอันตรายที่บ่งบอกถึงการกระทำที่ไม่เหมาะสม

ข้อเท็จจริงสำคัญ

  • AWS กำลังสอบสวน Perplexity AI กรณีใช้โครงสร้างพื้นฐานคลาวด์ดูดข้อมูลเว็บไซต์ที่สั่งห้ามไว้
  • robots.txt คือมาตรฐานที่บอกบอทว่าห้ามเข้าถึงหน้าเว็บใด แต่ Perplexity ถูกพบว่าใช้ IP ลึกลับเลี่ยงกฎนี้
  • IP 44.221.181.252 ถูกตรวจพบในเซิร์ฟเวอร์ของสื่อยักษ์ใหญ่ เช่น Forbes และ The New York Times
  • Perplexity อ้างว่าการดูดข้อมูลบางส่วนทำโดยบริษัทภายนอก และบางส่วนทำตามคำสั่งเฉพาะเจาะจงของผู้ใช้
สรุปประเด็นความขัดแย้งระหว่าง Perplexity AI และผู้ให้บริการเนื้อหา
หัวข้อ จุดยืนของ Perplexity AI จุดยืนของ AWS / สำนักข่าว
การปฏิบัติตาม robots.txt อ้างว่า PerplexityBot ปฏิบัติตาม ยกเว้นกรณีผู้ใช้ระบุ URL พบหลักฐานการใช้ IP ลึกลับเลี่ยงการบล็อกเพื่อดูดข้อมูล
ความรับผิดชอบ ระบุว่าบางส่วนดำเนินการโดยบริษัทบุคคลที่สาม ลูกค้า AWS ต้องรับผิดชอบต่อการปฏิบัติตามข้อตกลงการใช้งาน
จริยธรรมข้อมูล มองว่าเป็นการดึงข้อมูลในนามผู้ใช้งาน มองว่าเป็นการขโมยเนื้อหาและละเมิดลิขสิทธิ์สื่อ

คำถามที่พบบ่อย

robots.txt คืออะไรและสำคัญอย่างไร?

คือไฟล์ข้อความธรรมดาที่เจ้าของเว็บไซต์วางไว้เพื่อให้บอทหรือโปรแกรมอัตโนมัติทราบว่าส่วนใดของเว็บไซต์ที่อนุญาตหรือไม่อนุญาตให้เก็บข้อมูล เพื่อป้องกันการนำเนื้อหาไปใช้โดยไม่ได้รับอนุญาตหรือลดภาระของเซิร์ฟเวอร์

ทำไม AWS ถึงต้องเข้ามาสอบสวน Perplexity AI?

เนื่องจาก Perplexity ใช้บริการ EC2 ของ AWS ในการรันระบบ หากมีการใช้โครงสร้างพื้นฐานของ AWS เพื่อทำกิจกรรมที่ละเมิดข้อตกลงการใช้งาน (Terms of Service) เช่น การดูดข้อมูลในทางที่ผิด AWS มีหน้าที่ต้องตรวจสอบและดำเนินการตามกฎ

Perplexity AI แก้ไขปัญหาที่เกิดขึ้นอย่างไร?

จากข้อมูลล่าสุด ทางโฆษกของบริษัทระบุว่าไม่ได้มีการเปลี่ยนแปลงการดำเนินงานใดๆ หลังจากได้รับคำถามจาก AWS โดยยืนยันว่าบริการที่ควบคุมโดย Perplexity ไม่ได้ละเมิดกฎของ AWS

การระบุ URL ใน Prompt ของ AI ถือเป็นการละเมิดหรือไม่?

ในมุมของ Perplexity มองว่าเป็นการทำแทนผู้ใช้ แต่ในมุมของสมาคมเนื้อหาดิจิทัลและสำนักข่าว มองว่าการที่ AI เข้าไปดึงข้อมูลจากหน้าที่สั่งห้ามไว้ (แม้จะผ่านคำสั่งผู้ใช้) ก็ยังเป็นการละเมิดหลักการและข้อตกลงการใช้งานของเว็บไซต์นั้นๆ