AI & ML
Microsoft เปิดตัว MAI-Transcribe-2 ถอดเสียง 60 ภาษา ภาษาไทยแม่นสุด ราคาถูกสุดในตลาด
Nokka Dev.to (EN Zone)
1 views
Microsoft เปิดตัว MAI-Transcribe-2 ถอดเสียง 60 ภาษา ภาษาไทยแม่นสุด ราคาถูกสุดในตลาด
Microsoft AI เปิดตัว MAI-Transcribe-2 โมเดลถอดเสียงพูดเป็นข้อความรุ่นล่าสุดเมื่อวันที่ 3 กันยายน 2026 โดยระบุว่าเป็นโมเดลถอดเสียงที่เร็วที่สุด แม่นยำที่สุด และถูกที่สุดในตลาดขณะนี้ รองรับ 60 ภาษา รวมถึงภาษาไทย และทำคะแนนอันดับหนึ่งบนมาตรฐาน FLEURS ด้วยอัตราความผิดพลาดของคำเฉลี่ย 5.2% ทั่วทั้ง 60 ภาษา [1]
สเปกและฟีเจอร์ใหม่
MAI-Transcribe-2 เป็นโมเดลถอดเสียงรุ่นที่สามในรอบห้าเดือนของ Microsoft AI โดยขยายการรองรับภาษาจาก 43 ภาษาในรุ่น 1.5 (มิถุนายน) และ 25 ภาษาในรุ่นแรก (เมษายน) มาเป็น 60 ภาษาในรุ่นนี้
ฟีเจอร์ที่เพิ่มเข้ามาในรุ่นนี้ประกอบด้วย:
**การแยกผู้พูด (speaker diarization): ระบุว่าใครพูดอะไรในไฟล์เสียงที่มีหลายคน ซึ่งเป็นความแตกต่างระหว่าง "ข้อความก้อนเดียว" กับ "บันทึกการประชุมที่ใช้ได้จริง"
**เวลากำกับรายคำ (word-level timestamps): ระบุเวลาที่แน่นอนของทุกคำ รองรับการค้นหา แก้ไข และซิงก์กับวิดีโอ
**การปรับคำเฉพาะทาง (keyword biasing): ให้ผู้พัฒนาป้อนรายชื่อยา รหัสสินค้า หรือชื่อพนักงาน เพื่อให้โมเดลไม่เพี้ยนศัพท์เฉพาะ
**การสลับภาษา (code switching): รองรับบทสนทนาที่สลับภาษากลางประโยค เช่น ฮิงลิช (ฮินดีผสมอังกฤษ) และสแปงลิช (สเปนผสมอังกฤษ)
โหมดถอดเสียงสองแบบ: แบบ "verbatim" เก็บคำอุทานและเสียงติดขัดครบถ้วนสำหรับงานกฎหมายและตรวจสอบ และแบบ "clean" ตัดคำฟุ่มเฟือยเพื่อให้ได้คำบรรยายที่อ่านง่าย
ผลการทดสอบมาตรฐาน
Microsoft อ้างผลการทดสอบสามด้าน โดยแต่ละด้านใช้มาตรวัดต่างกัน
ด้านแรกคือ FLEURS ซึ่งเป็นมาตรฐานที่นักวิจัยของ Google เผยแพร่ในปี 2022 สร้างจากเจ้าของภาษาที่อ่านประโยคประมาณ 2,000 ประโยคใน 102 ภาษา MAI-Transcribe-2 ทำอันดับหนึ่งด้วยอัตราความผิดพลาดของคำเฉลี่ย 5.2% ทั่ว 60 ภาษา
สำหรับภาษาไทยโดยเฉพาะ MAI-Transcribe-2 ทำอัตราความผิดพลาดของคำที่ 3.4% ซึ่งดีที่สุดในตารางเปรียบเทียบ เหนือกว่า Gemini 3.5 Transcribe (3.8%), Gemini 3.1 Pro (4.7%), GPT-transcribe (5.4%), Scribe v2 (6.1%) และ Whisper v3-large (8.7%)
ด้านที่สองคือ Artificial Analysis ซึ่งเป็นผู้ทดสอบอิสระที่วัดผ่าน API สาธารณะ MAI-Transcribe-2 ขึ้นมาอยู่อันดับสองบนกระดานอัตราความผิดพลาดของคำ และเป็นโมเดลที่กำหนด "Pareto frontier" ด้านความแม่นยำกับความหน่วง หมายความว่าไม่มีคู่แข่งรายใดแม่นกว่าโดยไม่ช้ากว่า หรือเร็วกว่าโดยไม่แม่นน้อยกว่า
ด้านที่สามคือความเร็วล้วน ๆ โดย Microsoft อ้างว่า MAI-Transcribe-2 เร็วกว่า GPT-Transcribe ของ OpenAI 10 เท่า เร็วกว่า Scribe v2 ของ ElevenLabs 7 เท่า และเร็วกว่า Gemini 3.5 Transcribe ของ Google 5 เท่า ตามการประเมินของ Artificial Analysis
ราคาและความเร็ว
MAI-Transcribe-2 เปิดตัวที่ราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียง ซึ่งเป็นราคาโปรโมชันถึงสิ้นปี ลดลงประมาณ 72% จากราคา 0.36 ดอลลาร์ของรุ่นแรกเมื่อห้าเดือนก่อน
VentureBeat ชี้ให้เห็นนัยของราคานี้ว่า สำหรับองค์กรที่ประมวลผลเสียงคอลเซ็นเตอร์ 100,000 ชั่วโมงต่อปี ซึ่งเป็นปริมาณปกติของธนาคารหรือผู้ให้บริการโทรคมนาคมขนาดใหญ่ ค่าใช้จ่ายจะลดลงจาก 36,000 ดอลลาร์เหลือ 10,000 ดอลลาร์ จนการถอดเสียงไม่ใช่รายการที่ต้องถกเถียงกันอีกต่อไป [2]
ความเร็วที่สูงยังช่วยลดต้นทุนการประมวลผล เพราะโมเดลที่ทำงานเร็วกว่าใช้ชั่วโมง GPU น้อยกว่า ซึ่งเป็นเหตุผลที่ Microsoft ตั้งราคาได้ต่ำและยังมีกำไร
บริบทเชิงกลยุทธ์
การเปิดตัวครั้งนี้เป็นส่วนหนึ่งของกลยุทธ์ที่ Microsoft ใช้สร้างโมเดลระดับแนวหน้าของตัวเองทีละรูปแบบ แล้วค่อย ๆ สลับเข้าไปแทนที่เทคโนโลยีของ OpenAI ในผลิตภัณฑ์ต่าง ๆ โดยการถอดเสียงเป็นรูปแบบที่เดินหน้าเร็วที่สุด
Mustafa Suleyman ประธานเจ้าหน้าที่บริหารของ Microsoft AI เคยให้สัมภาษณ์กับ The Verge ว่าโมเดลรุ่นแรกมาจาก "ทีมเล็ก ๆ ที่มุ่งเน้นเพียง 10 คน" ที่ "ปลอดจากระบบราชการ" และโมเดลทำงานด้วย "ต้นทุน GPU ครึ่งหนึ่งของโมเดลระดับแนวหน้าตัวอื่น"
ผลกระทบต่อคนไทย
สำหรับผู้ใช้และนักพัฒนาในไทย MAI-Transcribe-2 มีความน่าสนใจหลายจุด
ประการแรกคือความแม่นยำภาษาไทยที่ 3.4% ซึ่งดีที่สุดในตารางเปรียบเทียบ เหนือกว่า Whisper v3-large ที่เป็นโมเดลโอเพนซอร์สยอดนิยมอย่างชัดเจน (8.7%) สำหรับงานที่ต้องการความแม่นยำสูง เช่น การถอดเสียงประชุม การทำคำบรรยายวิดีโอ หรือการแปลงเสียงสัมภาษณ์เป็นข้อความ นี่เป็นตัวเลือกที่น่าสนใจ
ประการที่สองคือราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียง หรือประมาณ 3 บาทต่อชั่วโมงเสียง ซึ่งต่ำพอที่ธุรกิจขนาดเล็กและผู้สร้างคอนเทนต์จะเริ่มใช้ได้โดยไม่ต้องกังวลเรื่องงบประมาณ
ประการที่สามคือการเข้าถึง โมเดลนี้ใช้งานได้ผ่าน Microsoft Foundry, MAI Playground และ OpenRouter ซึ่งนักพัฒนาไทยที่ใช้ API อยู่แล้วสามารถเริ่มทดสอบได้ทันที [3]
แต่ควรระลึกว่าผลการทดสอบดังกล่าวเป็นข้อมูลจากผู้พัฒนา และประสิทธิภาพจริงอาจแตกต่างกันตามระบบทดสอบและวิธีติดตั้ง โดยเฉพาะ FLEURS ที่ใช้เสียงอ่านจากเจ้าของภาษา ไม่ใช่บทสนทนาจริงที่มีเสียงรบกวนและพูดซ้อนกัน
แหล่งอ้างอิง
[1] Microsoft AI, "MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world" (3 ก.ย. 2026), https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
[2] VentureBeat, "Microsoft AI's MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed" (3 ก.ย. 2026), https://venturebeat.com/infrastructure/microsoft-ais-mai-transcribe-2-undercuts-openai-google-and-elevenlabs-on-price-and-speed
[3] Microsoft Learn, "MAI-Transcribe in Azure Speech (preview)" (2026), https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe
Read original: https://dev.to/sarantoon/microsoft-epidtaw-mai-transcribe-2-thdesiiyng-60-phaasaa-phaasaaaithyaemnsud-raakhaathuuksudaintlaad-3n
← Previous
Amazon, Etsy & Shopify product image size cheat sheet (2026) + a free in-browser checker
Next →
OmniVoice โมเดล TTS 600+ ภาษา โคลนเสียงจากคลิป 3 วินาที เปิดซอร์สฟรี
Related
W
What breaks when you ship 21 AI tools that never touch a server
AI & ML
0
DEV Community
T
The 404 only we could see: 23.8 hours inside a cache entry we made ourselves
AI & ML
0
DEV Community
W
What Should a Board Ask Before Approving an AI Coding Tool Rollout?
AI & ML
0
Dev.to (EN Zone)
C
Claims, Not Facts: Building an Auditable Multi-Author Record for a House
AI & ML
0
DEV Community
Comments0
No comments yet — be the first