
MAI-Transcribe-2 โมเดล AI จาก Microsoft ถอดภาษาไทยแม่นยำ 96.6%
Microsoft อัปเดต MAI-Transcribe-2 โมเดลถอดเสียงรองรับ 60 ภาษา ถอดไฟล์ 1 ชั่วโมงเสร็จใน 10 วินาที พร้อมความแม่นยำภาษาไทย 96.6%
Microsoft ประกาศอัปเดต MAI-Transcribe-2 โมเดล AI รุ่นใหม่ที่ถูกออกแบบมาสำหรับถอดเสียงออกมาเป็นข้อความ ที่มีขีดความสามารถในการถอดเสียงบันทึกออกมาเป็นคำพูดอย่างแม่นยำ สามารถประมวลผลไฟล์เสียงเร็วกว่าโมเดลตามท้องตลาดหลายเท่า และสามารถถอดเสียงภาษาไทยได้แม่นยำที่สุด
ตัวโมเดลโดดเด่นในด้านการลงรายละเอียดเชิงลึกระหว่างการพูด ทั้งในส่วนการแยกผู้พูด ระบุเวลาและเนื้อหารายละเอียดแบบคำต่อคำได้อย่างแม่นยำ รองรับไฟล์ที่มีเสียงรบกวนสูง การพูดผสมหลายภาษาในเนื้อหา ตลอดจนเลือกสไตล์การถอดความว่าให้เก็บทุกรายละเอียด และแยกเนื้อหาให้อ่านง่ายได้
MAI-Transcribe-2 รองรับการใช้งานร่วมกับภาษามากถึง 60 ภาษา ในขั้นตอนการทดสอบพบว่า อัตราความผิดพลาดเฉลี่ยในการถอดเสียงอยู่ที่ราว 5.2% ต่ำกว่าโมเดลอื่นในระดับใกล้เคียงกัน โดยเฉพาะภาษาไทยที่สามารถอดเสียงออกมาได้อย่างแม่นยำ โดยมีอัตราการผิดพลาดที่เพียง 3.4% เท่านั้น
อีกหนึ่งจุดเด่นของโมเดลอยู่ในด้านความเร็วในการถอดเนื้อหา รองรับการถอดเสียงสดแบบเรียลไทม์ ทั้งยังสามารถถอดเนื้อหาจากไฟล์เสียงความยาวระดับ 1 ชั่วโมงให้เสร็จสิ้นในระยะเวลาเพียง 10 วินาที เร็วกว่าโมเดลถอดเสียงเจ้าอื่นในท้องตลาดมากถึง 5 – 10 เท่า
ในด้านต้นทุนการใช้งานโดยพื้นฐานโมเดลนีมีอัตราค่าบริการอยู่ที่ 0.10 ดอลลาร์(ราว 3.2 บาท) ต่อไฟล์เสียง 1 ชั่วโมง ทำให้นี่เป็นตัวเลือกของโมเดลถอดเสียงน่าสนใจ โดยเฉพาะการดึง API ไปใช้ร่วมกับการถอดเสียงสตรีมมิ่ง ทำซับไตเติ้ลแบบเรียลไทม์ หรือเชื่อมต่อเข้ากับ Voice Agent เพื่อรองรับคำสั่งเสียงต่อไป
สำหรับท่านที่สนใจ MAI-Transcribe-2 เปิดให้เข้าถึงและใช้งานผ่าน API และ Azure Speech Service แล้ววันนี้







