ความผิดพลาดส่วนใหญ่ของการแปลงเสียงเป็นข้อความเริ่มที่เสียง ไม่ใช่ที่โปรแกรม สี่เรื่องที่ช่วยได้มากที่สุดคือ ไมค์อยู่ใกล้คนพูด เสียงรบกวนน้อย พูดทีละคน และ ตั้งภาษาให้ถูก จากนั้นพูดเป็นประโยคที่จบในตัวด้วยจังหวะสม่ำเสมอ พูดชื่อและตัวเลขให้ชัด และอ่านข้อความหนึ่งรอบก่อนใช้ การเรียบเรียงด้วย AI ช่วยเรื่องการแบ่งวรรคและคำเติมได้ แต่แก้คำที่ถอดผิดตั้งแต่แรกไม่ได้
| ปัญหาในข้อความ | สาเหตุที่น่าจะเป็น | แก้อย่างไร |
|---|---|---|
| คำหายหรือเพี้ยน | ไมค์ไกลเกินไป หรือมีเสียงรบกวน | ขยับโทรศัพท์เข้าใกล้ ย้ายไปที่เงียบ |
| ผิดทั้งช่วง | ตั้งภาษาผิด หรือพูดสองภาษาสลับกันยาว ๆ | ตั้งภาษาที่พูด พูดภาษาเดียวต่อหนึ่งไฟล์ถ้าทำได้ |
| ศัพท์อังกฤษกลางประโยคผิด | ระบบคาดว่าจะเป็นคำไทย | พูดศัพท์อังกฤษให้ชัดเป็นคำ ๆ แล้วตรวจทีหลัง |
| ชื่อคน ชื่อเล่น ชื่อแบรนด์ผิด | คำที่ไม่คุ้น | พูดให้ชัด สะกดหนึ่งครั้ง แล้วแก้ทีหลัง |
| ตัวเลขผิด | “สิบห้า” กับ “ห้าสิบ” ฟังคล้ายกันเมื่อเสียงไม่ชัด | พูดช้าลง หรือพูดทีละหลัก “หนึ่ง ห้า” |
| สองเสียงปนกัน | คนพูดแทรกกัน | ผลัดกันพูด เว้นจังหวะก่อนตอบ |
| ไม่มีข้อความเลย | ไฟล์เงียบหรือเสียงเบามาก | ตรวจระดับเสียง ลองอัดสั้น ๆ ก่อน |
ไมค์และห้อง
แนวทางปฏิบัติของ Google สำหรับบริการ Cloud Speech-to-Text เขียนไว้ชัดว่า “Position the microphone as close as possible to the person that is speaking, particularly when background noise is present” ในทางปฏิบัติ:
- ถือโทรศัพท์ใกล้ปาก เวลาพูดใส่ ประมาณระยะคุยโทรศัพท์ และอย่าให้นิ้วหรือเคสบังรูไมค์
- เลือกห้องเงียบ ปิดเพลง ทีวี และพัดลม ห้องเล็กที่มีผ้าม่านหรือโซฟาเสียงก้องน้อยกว่าห้องครัวหรือบันได
- หลบลม ถ้าอยู่กลางแจ้ง หันหลังให้ลม หรือใช้หูฟังมีไมค์
- อย่าตะโกน Google แนะนำให้ “avoid audio clipping” การพูดดังกว่าปกติใกล้ไมค์ทำให้เสียงแตก
- อัดประชุมจากกลางโต๊ะ ไม่ใช่จากหัวโต๊ะ เสียงทุกคนจะมาถึงโทรศัพท์ในระดับใกล้กัน
วิธีพูด
- พูดเป็นประโยคที่จบในตัว จังหวะสม่ำเสมอ ไม่ต้องพูดช้า แต่พูดต่อเนื่องและเว้นจังหวะสั้น ๆ ระหว่างความคิด ดีกว่าพูดเป็นท่อน ๆ
- ภาษาไทยปนอังกฤษ เป็นเรื่องปกติในที่ทำงาน แต่คำอังกฤษกลางประโยคไทยเป็นจุดที่ผิดบ่อย ถ้าคำนั้นสำคัญ เช่น ชื่อโปรเจกต์ ให้พูดชัด ๆ และตรวจในข้อความ
- พูดชื่อให้ชัด ชื่อเล่นสั้น ๆ อย่าง “ปอ” “ต้น” “นุ่น” ฟังผิดง่าย บอกชื่อเต็มหรือบริบทครั้งแรก เช่น “คุณนุ่นฝ่ายบัญชี”
- พูดตัวเลขให้ชัด เช่น “หนึ่งพันสองร้อยห้าสิบบาท” หรือพูดทีละหลักสำหรับเบอร์โทรและเลขอ้างอิง
- ผลัดกันพูด ถ้าสองคนพูดพร้อมกัน ทั้งสองคนมักออกมาผิด
- เว้นจังหวะหลังกดอัดและก่อนกดหยุด คำแรกและคำสุดท้ายจะได้ไม่ขาด
- สำเนียงและภาษาถิ่น ถ้าคุณพูดภาษาถิ่นหรือสำเนียงท้องถิ่นเป็นหลัก ลองอัดไฟล์สั้น ๆ ก่อน แล้วดูว่าเครื่องมือที่ใช้ถอดได้ดีแค่ไหน เราไม่มีตัวเลขเปรียบเทียบเรื่องนี้
การตั้งค่าที่มีผล
- เลือกภาษาที่พูด ในเครื่องมือที่ให้เลือก Gboard, WhatsApp และแอปอัดเสียงในโทรศัพท์ต่างมีการตั้งค่าภาษาของตัวเอง ตั้งผิดทีเดียวผลลัพธ์เสียทั้งไฟล์ บางเครื่องมือไม่มีภาษาไทยให้เลือกเลย เช่น การถอดข้อความเสียงของ WhatsApp บน Android ดูWhatsApp ถอดข้อความเสียงเป็นภาษาไทยไม่ได้
- เพิ่มชื่อและศัพท์เฉพาะ ถ้าเครื่องมือมีรายการคำศัพท์ เอกสารของ Google แนะนำให้ใช้คำใบ้ “to add names and terms to the vocabulary”
- เก็บไฟล์ต้นฉบับ ทุกครั้งที่อัดซ้ำหรือบีบอัดไฟล์ รายละเอียดจะหายไป ถอดเสียงจากไฟล์ที่เครื่องอัดสร้าง ไม่ใช่ไฟล์ที่อัดจากลำโพงอีกที สำหรับบริการของตัวเอง Google แนะนำรูปแบบไม่สูญเสีย (FLAC หรือ LINEAR16) และอัตราสุ่ม 16,000 Hz
- ไม่ต้องลดเสียงรบกวนทีหลัง Google ไม่แนะนำการปรับระดับเสียงอัตโนมัติและการลดเสียงรบกวนสำหรับบริการของตัวเอง และบอกว่าระบบรู้จำเสียงออกแบบมาให้ไม่สนเสียงพื้นหลังอยู่แล้ว
เสียงที่ฟังยาก
ถ้าอัดไปแล้วและฟังไม่ค่อยชัด:
- ถอดเสียงทั้งไฟล์หนึ่งรอบ แล้วดูว่าช่วงไหนเพี้ยน
- ฟังช่วงที่เพี้ยนด้วยความเร็วช้าลง ใส่หูฟัง แล้วพิมพ์เอง
- ทำเครื่องหมายช่วงที่ฟังไม่ได้ เป็น [ฟังไม่ชัด] แทนการเดา คำที่เดาผิดในคำพูดที่ยกมาหรือในรายงานการประชุม แย่กว่าช่องว่าง
- อย่าหวังปาฏิหาริย์กับเสียงที่อยู่ไกลมาก ถ้าคุณเองยังแทบไม่ได้ยิน โปรแกรมก็กู้กลับมาได้ไม่แน่นอนเช่นกัน
ทดสอบความแม่นยำด้วยตัวเอง
ความแม่นยำของการแปลงเสียงเป็นข้อความมักวัดเป็น อัตราความผิดพลาดของคำ (WER): WER = (S + D + I) / N โดย S คือจำนวนคำที่ถูกแทนด้วยคำอื่น D คือคำที่หายไป I คือคำที่เกินมา และ N คือจำนวนคำในข้อความอ้างอิงที่ถูกต้อง ยิ่งต่ำยิ่งดี
ภาษาไทยเขียนติดกันไม่เว้นวรรคระหว่างคำ การนับ “คำ” เองจึงไม่ง่าย สำหรับการทดสอบที่บ้าน นับเป็นพยางค์แทนก็ได้ ขอแค่ใช้วิธีนับแบบเดียวกันทุกรอบ ใช้เวลาห้านาที:
- เลือกข้อความประมาณ 100 พยางค์ ที่มีชื่อคนและตัวเลขสองสามจุด
- อ่านออกเสียงใส่เครื่องมือของคุณ ในสภาพที่ใช้งานจริง
- นับพยางค์ที่ผิด หาย หรือเกินมา แล้วหารด้วยจำนวนพยางค์ทั้งหมด
- เปลี่ยนทีละอย่าง (ระยะห่าง ห้อง การตั้งค่าภาษา) แล้วทำซ้ำ
ผลที่ได้บอกว่าอะไรช่วยได้กับเสียงของคุณ โทรศัพท์ของคุณ และห้องของคุณ แต่ใช้เปรียบเทียบเครื่องมือโดยทั่วไปไม่ได้ ตัวเลขความแม่นยำที่เผยแพร่กันใช้ได้เฉพาะกับเสียงชุดที่ใช้วัดเท่านั้น
AI เรียบเรียงแก้อะไรได้ และแก้อะไรไม่ได้
Retexta เป็นแอป Android สำหรับแปลงเสียงเป็นข้อความและช่วยเขียนด้วย AI ที่ประมวลผลบนคลาวด์ แอปถอดเสียงก่อน แล้วเรียบเรียงข้อความได้ การเรียบเรียงช่วยเรื่องที่ทำให้ข้อความถอดเสียงดิบอ่านยาก:
- การเว้นวรรคและการแบ่งย่อหน้า
- คำเติมและประโยคที่เริ่มแล้วทิ้ง (“คือ” “แบบว่า” “เอ่อ”)
- ท่อนที่พูดซ้ำและประโยคที่ขาด
ถ้าอยากให้แค่เกลาข้อความ ใช้เป้าหมาย Clean up a text (ใน More templates) ซึ่งแอปอธิบายว่าคงข้อความของคุณไว้ แล้วแก้ไวยากรณ์ เครื่องหมายวรรคตอน และความลื่นไหล เป้าหมายที่เขียนใหม่ เช่น Write a message หรือ Take notes จะเรียบเรียงสิ่งที่คุณพูดใหม่มากกว่า เมนูของแอปเป็นภาษาอังกฤษ
สิ่งที่การเรียบเรียงทำไม่ได้คือรู้ว่า “คุณนุ่น” ถูกฟังเป็น “คุณหนุ่ม” หรือ “สิบห้า” ควรเป็น “ห้าสิบ” และอาจทำให้คำที่ผิดกลายเป็นประโยคที่ลื่นและดูถูกต้อง จึงต้องตรวจ ชื่อ ตัวเลข วันที่ และจำนวนเงิน กับเสียงต้นฉบับ ผลลัพธ์ของ Retexta มีป้าย “AI-generated. Check important details.”
สองรายละเอียดของแอปที่เกี่ยวกับความแม่นยำ: Retexta จับภาษาที่พูดได้เอง ไฟล์สั้นที่มีประโยคแรกครบจึงให้ข้อมูลกับระบบมากกว่าคำเดียว และถ้าไฟล์เงียบหรือเบามาก แอปจะแจ้งแทนการส่งข้อความกลับมา (“Transcription finished, but no text was produced”) เรายังไม่ได้วัดความแม่นยำของ Retexta กับเสียงภาษาไทย จึงไม่มีตัวเลขให้
ลองใช้ Retexta ได้ฟรี: ผู้ใช้ใหม่จะได้ผลลัพธ์ Pro ฟรีจำนวนหนึ่งไว้ดูในแอป หลังจากนั้น Transcript only ก็ต้องใช้ Retexta Pro หรือเครดิตเช่นกัน เป้าหมายที่เรียบเรียงใหม่และ Import audio เป็นฟีเจอร์ของ Retexta Pro และการคัดลอก แชร์ หรือส่งออกผลลัพธ์ต้องใช้ Retexta Pro หรือเครดิต
อ่านต่อ
ไฟล์บันทึกเสียงในโทรศัพท์: ถอดเสียงไฟล์บันทึกเสียงเป็นข้อความบน Android พิมพ์ด้วยเสียงแทนการพิมพ์: พิมพ์อีเมลด้วยเสียงบน Android สองเสียงในไฟล์เดียว: วิธีถอดเทปสัมภาษณ์ รูปแบบไฟล์: แปลงไฟล์ MP3 เป็นข้อความ ข้อมูลแอปเพิ่มเติม: Retexta แปลงเสียงเป็นข้อความบน Android
แหล่งที่มา
FLAME Apps ตรวจสอบเมื่อ 25 กันยายน 2569
- Google Cloud, Best practices, Cloud Speech-to-Text (อัปเดตล่าสุด 18 กันยายน 2569): ตำแหน่งไมค์ เสียงแตก อัตราสุ่ม รูปแบบไม่สูญเสีย ไม่ใช้การปรับระดับเสียงหรือลดเสียงรบกวน และคำใบ้คำศัพท์ ทั้งหมดนี้เป็นคำแนะนำสำหรับบริการของ Google เอง
- Wikipedia, Word error rate: นิยาม WER = (S + D + I) / N
- โค้ดแอป Retexta (Android เวอร์ชัน 2026.1.23): การจับภาษาอัตโนมัติ (
RecordScreen.kt,TranscriptionLanguageCatalog.kt), คำอธิบายเป้าหมาย Clean up a text และข้อความแจ้งข้อผิดพลาด (ข้อความในแอป)
