Imagen AI จาก Google นวัตกรรมสร้างภาพจากข้อความที่เน้นความสมจริงขั้นสูงสุด

ในโลกของปัญญาประดิษฐ์ที่กำลังพัฒนาอย่างก้าวกระโดด Google ได้เปิดตัว Imagen ระบบ AI อัจฉริยะที่สามารถเปลี่ยนคำบรรยายตัวอักษรให้กลายเป็นรูปภาพได้อย่างน่าทึ่ง โดยจุดเด่นที่ทำให้ Imagen แตกต่างคือความสามารถในการสร้างภาพที่มีความสมจริง (Photorealism) ในระดับที่สูงมาก พร้อมทั้งมีความเข้าใจในบริบทของภาษาอย่างลึกซึ้ง

Imagen ถูกพัฒนาขึ้นโดยทีม Brain Team จาก Google Research โดยใช้เทคโนโลยีที่เรียกว่า Diffusion Model ซึ่งเป็นโมเดลการแพร่กระจายของข้อมูลที่ช่วยให้ AI สามารถสร้างภาพที่มีรายละเอียดซับซ้อนและแม่นยำตามคำสั่งของผู้ใช้ แม้ว่าในตลาดจะมีเครื่องมืออย่าง DALL-E ของ OpenAI ที่สร้างชื่อเสียงมาก่อน แต่ Google มุ่งเน้นไปที่การยกระดับความสมจริงของภาพให้ใกล้เคียงกับภาพถ่ายจริงมากที่สุด

การทดสอบประสิทธิภาพและความเหนือชั้น

เพื่อให้เห็นภาพชัดเจนว่า Imagen มีประสิทธิภาพเพียงใด ทีมวิจัยได้สร้างเกณฑ์มาตรฐานที่ชื่อว่า DrawBench ซึ่งประกอบด้วยชุดคำสั่ง (Prompts) จำนวน 200 รายการ เพื่อนำไปทดสอบกับโมเดล AI ชื่อดังหลายตัว เช่น DALL-E 2, VQ-GAN+CLIP และ Latent Diffusion Models

ผลการประเมินโดยมนุษย์พบว่า ผู้ทดสอบส่วนใหญ่พึงพอใจในผลลัพธ์ของ Imagen มากกว่าโมเดลอื่น ทั้งในด้านคุณภาพของตัวอย่างภาพ และความสอดคล้องระหว่างข้อความที่สั่งกับภาพที่ปรากฏ อย่างไรก็ตาม ควรระลึกว่าภาพตัวอย่างที่เผยแพร่บนเว็บไซต์ของ Google นั้นผ่านการคัดเลือกมาแล้ว ซึ่งอาจเป็นผลลัพธ์ที่ดีที่สุดและไม่ได้สะท้อนถึงภาพทุกภาพที่ AI สร้างขึ้น

Imagen text-to-image creations

ความท้าทายด้านจริยธรรมและเหตุผลที่ยังไม่เปิดให้ใช้งานทั่วไป

แม้จะมีประสิทธิภาพสูง แต่ Google ยังไม่เปิดให้สาธารณชนใช้งาน Imagen ได้อย่างอิสระ เนื่องจากความกังวลด้านความปลอดภัยและจริยธรรม เนื่องจากโมเดลเหล่านี้ถูกฝึกฝนด้วยชุดข้อมูลมหาศาลที่ดึงมาจากอินเทอร์เน็ต ซึ่งมักจะมีข้อมูลที่ไม่ผ่านการคัดกรอง

ทีมวิจัยยอมรับว่าการใช้ชุดข้อมูลขนาดใหญ่ เช่น LAION-400M อาจทำให้ AI ซึมซับอคติทางสังคม (Social Biases) มุมมองที่กดขี่ หรือการสร้างภาพลักษณ์ที่สร้างความเสียหายต่อกลุ่มคนชายขอบ ตัวอย่างที่พบคือ AI มีแนวโน้มที่จะสร้างภาพบุคคลที่มีผิวสีอ่อน หรือกำหนดบทบาททางเพศตามความเชื่อเดิมๆ ของสังคม ซึ่งอาจนำไปสู่การนำไปใช้ในทางที่ผิดหากเปิดให้ใช้งานโดยไม่มีการควบคุม

Article image

แนวทางการพัฒนาในอนาคตและการทดลองใช้งาน

Google กำลังศึกษาโครงสร้างการเปิดให้ใช้งานภายนอกอย่างมีความรับผิดชอบ เพื่อสร้างสมดุลระหว่างการตรวจสอบจากภายนอกและความเสี่ยงจากการเข้าถึงแบบไม่จำกัด

สำหรับผู้ที่สนใจ ปัจจุบันสามารถทดลองใช้งาน Imagen ได้ในวงจำกัดผ่านเว็บไซต์ โดยการเลือกคำสำคัญที่กำหนดไว้ล่วงหน้า เช่น การเลือกประเภทของภาพ (ภาพถ่ายหรือภาพวาดสีน้ำมัน), ชนิดของสัตว์, เครื่องแต่งกาย, กิจกรรม และสถานที่ ซึ่งช่วยให้ผู้ใช้สร้างภาพแปลกๆ เช่น แพนด้าใส่แว่นกันแดดและแจ็คเก็ตหนังกำลังเล่นสเก็ตบอร์ดบนชายหาดในรูปแบบภาพวาดสีน้ำมันได้

Image 2

ข้อเท็จจริงสำคัญ

  • ผู้พัฒนา: ทีม Brain Team จาก Google Research
  • เทคโนโลยีหลัก: Diffusion Model ที่เน้นความสมจริงของภาพและความเข้าใจภาษา
  • การวัดผล: ใช้ DrawBench (200 คำสั่ง) ในการเปรียบเทียบกับ AI ตัวอื่น
  • ข้อจำกัด: ยังไม่เปิดให้ใช้งานทั่วไปเนื่องจากปัญหาเรื่องอคติทางสังคม (Social Bias) ในชุดข้อมูล
  • ชุดข้อมูลที่ใช้: มีการใช้ LAION-400M ซึ่งอาจมีเนื้อหาที่ไม่เหมาะสมปนอยู่
ตารางเปรียบเทียบจุดเด่นและข้อควรระวังของ Imagen AI
หัวข้อ รายละเอียด
จุดแข็ง ความสมจริงระดับสูง (Photorealism) และความแม่นยำตามคำสั่ง
คู่แข่งสำคัญ DALL-E 2, VQ-GAN+CLIP, Latent Diffusion Models
ความเสี่ยง การผลิตซ้ำภาพลักษณ์ที่เกิดจากอคติทางสังคมและเชื้อชาติ
สถานะปัจจุบัน เปิดให้ทดลองใช้งานแบบจำกัด (Limited Basis)

คำถามที่พบบ่อย

Imagen คืออะไร?

Imagen คือระบบ AI ของ Google ที่สามารถสร้างรูปภาพที่มีความสมจริงสูงจากคำบรรยายที่เป็นข้อความ โดยใช้เทคโนโลยี Diffusion Model

Imagen ต่างจาก DALL-E อย่างไร?

แม้จะทำงานคล้ายกัน แต่ Imagen มุ่งเน้นไปที่การสร้างภาพที่มีความสมจริง (Photorealism) มากกว่า และผลการทดสอบจาก DrawBench ระบุว่าผู้ใช้พึงพอใจในคุณภาพและความสอดคล้องของภาพมากกว่า

ทำไม Google ถึงยังไม่เปิดให้คนทั่วไปใช้งาน Imagen?

เนื่องจาก AI ถูกฝึกด้วยข้อมูลจากเว็บที่ไม่ได้คัดกรอง ทำให้เกิดปัญหาเรื่องอคติทางสังคม เช่น การสร้างภาพที่ตอกย้ำความเชื่อผิดๆ เกี่ยวกับเพศหรือสีผิว ซึ่ง Google ต้องการแก้ไขปัญหานี้ก่อนเปิดใช้งานจริง

เราสามารถทดลองใช้ Imagen ได้อย่างไรในตอนนี้?

สามารถทดลองใช้ได้ในวงจำกัดผ่านเว็บไซต์ของ Google โดยการเลือกคำบรรยายจากตัวเลือกที่ระบบเตรียมไว้ให้ เพื่อสร้างภาพตามเงื่อนไขที่กำหนด

DrawBench คืออะไร?

คือเกณฑ์มาตรฐานที่ทีมวิจัยสร้างขึ้น โดยใช้คำสั่ง 200 รูปแบบ เพื่อนำมาเปรียบเทียบคุณภาพของภาพที่สร้างจาก AI หลายๆ โมเดลโดยใช้การประเมินจากมนุษย์