ใครที่ต้องเข้าประชุมกับชาวต่างชาติบ่อย ๆ อาจจะถูกใจโมเดล AI ถอดเสียงตัวใหม่ของ Meta
โมเดล AI ที่ถอดเสียงแบบเรียลไทม์ตัวแรกของ Meta ออกมาในชื่อ ‘Muse Voice Transcribe’ ความเจ๋งของเจ้า AI ตัวนี้คือมันจัดการถอดเสียงที่มีคนพูดสลับกันไปมาได้มากถึง 20 คน แถมยังรองรับหลายภาษาพร้อม ๆ กันด้วย
มาร์ก ซักเคอร์เบิร์ก (Mark Zuckerberg) ถึงกับคัมแบ็กกลับมาโพสต์บน X ในรอบ 3 ปี เพื่ออวดความเจ๋งของโมเดลนี้ให้ดูแบบชัด ๆ ในวิดีโอสาธิต
ซึ่งภายในวิดีโอเดโม จะมีคนเข้ามาพูดอธิบายทั้งภาษาอังกฤษ จีน และคนที่พูดภาษาอังกฤษติดสำเนียงภาษาแม่มาด้วย (ส่วนใหญ่ถ้าติดสำเนียง AI มักจะถอดเป็นคำพูดเป๊ะ ๆ ได้ยาก) เราจะเห็นเลยว่า ระบบแยกแยะเสียงพูดแต่ละคนได้แบบอัตโนมัติ และที่ว้าวคือมันเข้าใจการ ‘Code-switching’ หรือการพูดสลับภาษาไปมาในประโยคเดียว (ฟีลแบบคนไทยพูดไทยคำอังกฤษคำ) แล้วถอดความออกมาได้เป๊ะเลย
โดยเขาอธิบายเทคนิคเบื้องหลังไปว่า โมเดลตัวนี้ใช้ระบบ ‘Adaptive delay’ หรือการหน่วงเวลาแบบปรับตัวได้อัจฉริยะ คือถ้าเป็นคำง่าย ๆ มันจะถอดเสียงออกมาทันที แต่ถ้าเจอคำยากหรือประโยคซับซ้อน มันจะรอฟังบริบทอีกนิดเพื่อความแม่นยำ ระบบนี้สู้กับไฟล์เสียงที่คุณภาพแย่ได้สบาย ๆ ผ่านการเทรนมาแล้วกว่า 70 ภาษา (เปิดใช้งานแบบการันตีความแม่นยำแล้ว 25 ภาษา) และถอดเสียงการประชุมที่ยาวเป็นชั่วโมงได้ชิล ๆ
การเปิดตัวครั้งนี้ ของ Meta เกิดขึ้นตามหลัง Google ที่เพิ่งเปิดตัว Gemini 3.5 Transcribe มาติด ๆ แต่จุดที่ต่างกันคือ ตอนนี้ Google เตรียมฝัง AI ตัวนี้ลงใน Android และ Chrome แล้ว ในขณะที่ Meta ยังไม่ได้ประกาศชัดเจนว่าจะเอา Muse Voice Transcribe อันนี้ไปใส่ในแอปฯ หลักอย่าง Facebook หรือ WhatsApp เมื่อไหร่
ใครอยากลองใช้งานจริง ตอนนี้ไปเทสต์กันได้แล้วในแอปฯ Meta AI สำหรับ Mac ซึ่งระบบจะช่วยพิมพ์ตามคำบอกในแอปฯ อื่น ๆ บนเครื่องได้ด้วย นอกจากนี้ยังเปิดให้นักพัฒนาเอาไปต่อยอดผ่าน Muse Code และ Model API ในราคา 3 เหรียญสหรัฐฯ (ประมาณ 100 บาท) ต่อ 1,000 นาที หรือจะไปลองเล่นตัวเดโมฟรี ๆ บนบล็อกงานวิจัยของ Meta ก็มีให้ทดสอบเหมือนกัน













