Perplexity AI เครื่องมือค้นหาอัจฉริยะหรือแค่ตัวกลางดึงข้อมูลที่ขาดความโปร่งใส

ในโลกของเทคโนโลยี AI ที่เติบโตอย่างรวดเร็ว Perplexity AI ได้กลายเป็นชื่อที่ถูกพูดถึงอย่างมากจากการระดมทุนมหาศาลจากนักลงทุนระดับโลกอย่าง Jeff Bezos และ Nvidia โดยวางตำแหน่งตัวเองเป็นมากกว่าแค่แชตบอต แต่เป็น Answer Engine หรือเครื่องมือที่ให้คำตอบในรูปแบบภาษาธรรมชาติที่เข้าถึงข้อมูลบนอินเทอร์เน็ตได้แบบเรียลไทม์

อย่างไรก็ตาม เมื่อเจาะลึกลงไปถึงวิธีการทำงาน กลับพบความย้อนแย้งระหว่างสิ่งที่บริษัทกล่าวอ้างกับสิ่งที่เกิดขึ้นจริง ซึ่งนำไปสู่คำถามสำคัญว่า Perplexity คือนวัตกรรมการค้นหาที่ล้ำสมัย หรือเป็นเพียงระบบที่นำข้อมูลจากแหล่งอื่นมาสรุปใหม่โดยไม่ได้รับอนุญาต

เบื้องหลังการทำงาน: AI แท้จริงหรือแค่ 'ตัวหุ้ม' ระบบอื่น

หลายคนเข้าใจว่า Perplexity พัฒนาโมเดลภาษาขนาดใหญ่ (Large Language Model - LLM) ของตัวเองขึ้นมาทั้งหมด แต่ในความเป็นจริง ระบบนี้ทำงานในลักษณะของ Wrapper หรือตัวหุ้มที่เชื่อมต่อกับโมเดล AI ชื่อดังอื่นๆ เช่น LLaMa 3 จาก Meta รวมถึงโมเดลจาก OpenAI และ Anthropic

กระบวนการทำงานเริ่มต้นเมื่อผู้ใช้ป้อนคำถาม ระบบจะใช้ความสามารถในการเข้าถึงเว็บแบบเรียลไทม์เพื่อรวบรวมข้อมูล จากนั้นจึงส่งข้อมูลเหล่านั้นให้โมเดล AI ที่ผู้ใช้เลือกเพื่อประมวลผลและสร้างคำตอบออกมา ซึ่งทำให้ Perplexity มีลักษณะคล้ายกับ "ปลิง" ที่เกาะอยู่กับระบบ AI พื้นฐานที่มีอยู่แล้ว มากกว่าจะเป็นผู้สร้างนวัตกรรมโมเดล AI ด้วยตนเอง

ข้อพิพาทเรื่องการละเมิดมาตรฐานเว็บและการแอบดึงข้อมูล

ประเด็นที่ร้อนแรงที่สุดคือการที่ Perplexity ถูกกล่าวหาว่าละเมิด Robots Exclusion Protocol หรือไฟล์ robots.txt ซึ่งเป็นมาตรฐานสากลที่เจ้าของเว็บไซต์ใช้ระบุว่าไม่อนุญาตให้บอตตัวใดเข้ามาเก็บข้อมูล (Scraping) ในส่วนใดของเว็บไซต์บ้าง

จากการวิเคราะห์ของ WIRED และนักพัฒนาซอฟต์แวร์ พบว่า Perplexity ใช้ IP Address ลับ (เช่น 44.221.181.252) เพื่อหลบเลี่ยงการบล็อกและแอบเข้าไปดึงข้อมูลจากเว็บไซต์ที่สั่งห้ามไว้ชัดเจน ซึ่งเป็นการกระทำที่ขัดกับคำกล่าวอ้างของบริษัทที่ระบุว่าเคารพความเป็นส่วนตัวและมาตรฐานของเจ้าของเว็บไซต์

Image 2

ปัญหาความแม่นยำและการสร้างข้อมูลเท็จ (Hallucination)

แม้จะชูจุดเด่นเรื่องความน่าเชื่อถือและการระบุแหล่งที่มา แต่ Perplexity กลับประสบปัญหา AI Hallucination หรือการที่ AI "หลอน" สร้างข้อมูลที่ไม่มีอยู่จริงขึ้นมาอย่างมั่นใจ

  • การสรุปผิดพลาด: มีกรณีที่ AI สรุปเนื้อหาข่าวผิดเพี้ยนไปจากความเป็นจริงอย่างรุนแรง
  • การสร้างเรื่องเท็จ: ในการทดสอบหนึ่ง AI ได้สร้างเรื่องราวแฟนตาซีเกี่ยวกับเด็กหญิงในป่าวิเศษ ทั้งที่ผู้ใช้สั่งให้สรุปเนื้อหาจากเว็บไซต์ที่มีเพียงประโยคเดียว
  • การกล่าวหาผิดตัว: มีการสร้างข้อมูลเท็จว่าเจ้าหน้าที่ตำรวจในแคลิฟอร์เนียก่ออาชญากรรม ทั้งที่ต้นฉบับไม่ได้ระบุเช่นนั้น

ปรากฏการณ์นี้สะท้อนว่า ในบางครั้ง Perplexity ไม่ได้อ่านเนื้อหาจากเว็บไซต์จริง แต่ใช้วิธีคาดเดาคำตอบจากเศษเสี้ยวข้อมูล (Metadata) ที่หลงเหลืออยู่ใน Search Engine อย่าง Google หรือ Bing แล้วนำมาประกอบร่างเป็นคำตอบที่ดูเหมือนจริงแต่ผิดพลาด

ข้อเท็จจริงสำคัญ

  • สถานะทางเทคนิค: เป็นเครื่องมือที่นำโมเดล AI ภายนอก (เช่น LLaMa 3, OpenAI) มาประยุกต์ใช้ ไม่ได้สร้าง Foundation Model เองทั้งหมด
  • พฤติกรรมการเก็บข้อมูล: พบการใช้ IP Address ลับเพื่อหลบเลี่ยงไฟล์ robots.txt ในการดึงข้อมูลจากเว็บไซต์ต่างๆ
  • ความน่าเชื่อถือ: มีหลักฐานการสร้างข้อมูลเท็จ (Hallucination) และการสรุปเนื้อหาที่คลาดเคลื่อนจากข้อเท็จจริง
  • ความสัมพันธ์กับสื่อ: ถูกวิจารณ์ว่าคัดลอกเนื้อหาจากสำนักข่าว เช่น Forbes และ WIRED โดยให้เครดิตในรูปแบบที่สังเกตเห็นได้ยาก
สรุปเปรียบเทียบคำกล่าวอ้าง vs ความเป็นจริงของ Perplexity AI
หัวข้อ คำกล่าวอ้างของบริษัท สิ่งที่ตรวจพบจริง
การเข้าถึงข้อมูล เคารพมาตรฐาน robots.txt ใช้ IP ลับแอบดึงข้อมูลจากเว็บที่สั่งบล็อก
ความแม่นยำ ให้คำตอบที่เชื่อถือได้พร้อมแหล่งอ้างอิง เกิดอาการหลอน (Hallucinate) และสร้างเรื่องเท็จ
รูปแบบบริการ เป็นบริษัทสตาร์ทอัพ AI นวัตกรรมใหม่ เป็น Wrapper ที่เชื่อมต่อกับโมเดล AI ของบริษัทอื่น
การส่งต่อทราฟฟิก เป็นแหล่งส่งผู้ใช้ไปยังเว็บข่าวรายใหญ่ จำนวนการส่งต่อ (Referral) ต่ำกว่าที่กล่าวอ้างมาก

คำถามที่พบบ่อย

Perplexity AI แตกต่างจาก Google Search อย่างไร?

ในขณะที่ Google ให้รายการลิงก์เพื่อให้ผู้ใช้คลิกเข้าไปอ่านเอง Perplexity จะทำหน้าที่เป็น "เครื่องมือให้คำตอบ" โดยการรวบรวมข้อมูลจากหลายแหล่งมาสรุปเป็นคำตอบเดียวในรูปแบบภาษาธรรมชาติ

การ Hallucinate ใน Perplexity คืออะไร?

คือสภาวะที่ AI สร้างข้อมูลที่ดูสมเหตุสมผลแต่ไม่เป็นความจริงขึ้นมา ซึ่งมักเกิดขึ้นเมื่อ AI ไม่สามารถเข้าถึงเนื้อหาต้นฉบับได้จริง จึงใช้วิธีคาดเดาจากข้อมูลที่เกี่ยวข้องในอินเทอร์เน็ต

ทำไมเจ้าของเว็บไซต์ถึงไม่พอใจ Perplexity?

เพราะ Perplexity ถูกตรวจพบว่าแอบดึงข้อมูล (Scraping) โดยไม่ได้รับอนุญาต และนำเนื้อหามาสรุปให้ผู้ใช้จนผู้ใช้ไม่จำเป็นต้องคลิกเข้าไปที่เว็บไซต์ต้นฉบับ ทำให้เจ้าของเว็บสูญเสียรายได้จากยอดเข้าชม

Perplexity ใช้ AI ของใครในการประมวลผล?

ผู้ใช้ระดับ Pro สามารถเลือกใช้โมเดลได้หลากหลาย เช่น Sonar Large 32k (ซึ่งพัฒนาต่อยอดจาก LLaMa 3 ของ Meta) รวมถึงโมเดลจากค่าย OpenAI และ Anthropic