چطور دقت تبدیل صدا به متن را بالا ببریم

برای تبدیل صدا به متن فارسی دقیق‌تر: فاصله میکروفون، سروصدا، سرعت حرف زدن، نام‌ها، تنظیمات، یک آزمون ساده دقت و کار بازنویسی هوش مصنوعی.

به‌روزرسانی 26 سپتامبر 2026 · 7 دقیقه مطالعه

بیشتر اشتباه‌های تبدیل صدا به متن از صدا شروع می‌شوند، نه از نرم‌افزار. بیشترین بهبود از چهار چیز می‌آید: میکروفون نزدیک گوینده، سروصدای کم، هر بار یک نفر و تنظیم درست زبان. بعد از آن، جمله‌های کامل با سرعت یکنواخت بگویید، نام‌ها و عددها را واضح بگویید و متن را یک بار قبل از استفاده بخوانید. بازنویسی هوش مصنوعی بعداً نشانه‌گذاری و کلمه‌های پرکننده را مرتب می‌کند، اما کلمه‌ای را که اشتباه شنیده شده نمی‌تواند درست کند.

مشکل در متن محتمل‌ترین علت چه چیزی را عوض کنید
کلمه‌ها جا افتاده یا درهم‌اند میکروفون دور است یا سروصدا زیاد گوشی را نزدیک‌تر بگیرید، جای آرام‌تری بروید
یک بخش کامل اشتباه است زبان اشتباه تنظیم شده، یا دو زبان قاطی شده زبان گفتار را درست کنید؛ هر ضبط یک زبان
نام‌ها و برندها اشتباه‌اند کلمه‌های کم‌کاربرد که سیستم انتظارشان را ندارد واضح بگویید، یک بار هجی کنید، بعد اصلاح کنید
دو صدا قاطی شده چند نفر هم‌زمان حرف زده‌اند نوبتی حرف بزنید؛ قبل از جواب مکث کنید
اصلاً متنی نیامده ضبط بی‌صدا یا خیلی کم‌صداست سطح ورودی را بررسی کنید؛ اول یک ضبط کوتاه آزمایش کنید

میکروفون و اتاق

راهنمای بهترین روش‌های گوگل برای سرویس Cloud Speech-to-Text ساده می‌گوید: «Position the microphone as close as possible to the person that is speaking, particularly when background noise is present»، یعنی میکروفون را تا جای ممکن نزدیک گوینده بگذارید، به‌خصوص وقتی سروصدای محیط هست. در عمل:

  • گوشی را نزدیک دهانتان بگیرید، تقریباً مثل وقت مکالمه تلفنی، و سوراخ میکروفون را با انگشت یا قاب نپوشانید.
  • اتاق آرام انتخاب کنید. موسیقی، تلویزیون و پنکه را خاموش کنید. اتاق کوچک با فرش و پرده کمتر از آشپزخانه یا راه‌پله پژواک دارد.
  • از باد پرهیز کنید. بیرون، پشت به باد بایستید یا از هدست استفاده کنید.
  • داد نزنید. گوگل توصیه می‌کند از «clipping» یا بریده شدن صدا پرهیز کنید. بلندتر از معمول حرف زدن نزدیک میکروفون صدا را خراب می‌کند.
  • جلسه را از وسط میز ضبط کنید، نه از یک سر آن، تا همه صداها با سطح مشابه به گوشی برسند.

چطور حرف بزنید

  • جمله کامل با سرعت یکنواخت. لازم نیست آهسته حرف بزنید، اما گفتار یکنواخت با مکث کوتاه بین فکرها بهتر از جمله‌های بریده‌بریده تبدیل می‌شود.
  • هر ضبط یک زبان. خیلی از فارسی‌زبان‌ها وسط جمله کلمه انگلیسی می‌گویند («این task رو تا deadline تموم کن»). این جابه‌جایی کار خیلی از سیستم‌ها را سخت می‌کند. اگر باید اصطلاحی به زبان دیگر بگویید، کوتاه نگهش دارید و بعد در متن بررسی‌اش کنید.
  • نام‌ها و عددها را واضح بگویید. برای نام کم‌کاربرد، یک بار آهسته بگویید یا هجی کنید. عددها را طوری بگویید که با عدد دیگری اشتباه نشود: «پانزده» و «پنجاه» را شمرده بگویید.
  • گفتاری یا نوشتاری؟ اگر محاوره‌ای حرف بزنید («می‌خوام بگم»)، متن خام هم ممکن است محاوره‌ای بیاید، یا ابزار آن را نیمه‌نوشتاری کند. برای متن رسمی، یا کمی نوشتاری‌تر حرف بزنید یا بعداً از بازنویسی استفاده کنید.
  • نوبتی حرف بزنید. وقتی دو نفر هم‌زمان حرف می‌زنند، معمولاً حرف هر دو اشتباه می‌آید.
  • بعد از زدن ضبط و قبل از قطع کردن کمی مکث کنید، تا اولین و آخرین کلمه بریده نشود.

تنظیماتی که مهم‌اند

  • زبان گفتار را انتخاب کنید، هرجا ابزار آن را می‌پرسد. تایپ صوتی Gboard، ترانویسی واتساپ و ضبط‌صوت‌های گوشی هرکدام تنظیم زبان خودشان را دارند و تنظیم اشتباه نتیجه را خراب می‌کند. در خیلی از این ابزارها فارسی اصلاً نیست؛ راهنمای ترانویسی واتساپ و فارسی یک نمونه را نشان می‌دهد.
  • نام‌ها و اصطلاح‌ها را اضافه کنید، اگر ابزارتان فهرست واژه دارد. مستندات گوگل برای سرویس خودش استفاده از راهنمایی واژه و عبارت را توصیه می‌کند تا نام‌ها و اصطلاح‌ها به واژگان اضافه شوند.
  • فایل اصلی را نگه دارید. هر بار ضبط دوباره یا فشرده‌سازی دوباره جزئیات را از بین می‌برد. فایلی را که ضبط‌کننده ساخته به متن تبدیل کنید، نه نسخه‌ای را که از بلندگو پخش و دوباره ضبط شده. گوگل برای سرویس خودش فرمت‌های بدون افت (FLAC یا LINEAR16) و نرخ نمونه‌برداری 16,000 هرتز را توصیه می‌کند.
  • بعداً کاهش نویز اضافه نکنید. گوگل برای سرویس خودش کنترل خودکار بهره و کاهش نویز را توصیه نمی‌کند و می‌گوید تشخیص‌دهنده‌اش طوری طراحی شده که صداهای پس‌زمینه و نویز را بدون حذف نویز اضافی نادیده بگیرد.

صدای سخت‌شنیدنی

اگر ضبط از قبل انجام شده و سخت فهمیده می‌شود:

  1. یک بار کل فایل را تبدیل کنید و ببینید کدام بخش‌ها خراب‌اند.
  2. بخش‌های خراب را با سرعت کمتر و با هدفون گوش دهید و خودتان تایپ کنید.
  3. آنچه را نمی‌شنوید با [نامفهوم] علامت بزنید، به‌جای حدس زدن. کلمه حدسی در نقل‌قول یا صورتجلسه از جای خالی بدتر است.
  4. از صدای خیلی دور معجزه نخواهید. اگر صدایی را خودتان به‌زحمت می‌شنوید، نرم‌افزار هم مطمئن آن را برنمی‌گرداند.

دقت را خودتان آزمایش کنید

دقت تبدیل صدا به متن معمولاً با نرخ خطای کلمه (WER) اندازه‌گیری می‌شود: WER = (S + D + I) / N، که S تعداد کلمه‌های جایگزین‌شده، D کلمه‌های حذف‌شده، I کلمه‌های اضافه‌شده و N تعداد کلمه‌های متن مرجع درست است. هرچه کمتر، بهتر.

نسخه خانگی پنج دقیقه طول می‌کشد:

  1. یک بند حدوداً 100 کلمه‌ای با چند نام و عدد انتخاب کنید.
  2. آن را با شرایط معمول خودتان در ابزارتان بخوانید.
  3. کلمه‌های اشتباه، جاافتاده یا اضافه را بشمارید و بر تعداد کلمه‌های بند تقسیم کنید.
  4. یک چیز را عوض کنید (فاصله، اتاق، تنظیم زبان) و دوباره امتحان کنید.

نتیجه به شما می‌گوید چه چیزی برای صدای شما، گوشی شما و اتاق شما کمک می‌کند. ابزارها را به‌طور کلی مقایسه نمی‌کند: هر عدد دقتی که منتشر می‌شود فقط برای همان صدایی معتبر است که با آن اندازه‌گیری شده.

بازنویسی هوش مصنوعی چه چیزی را درست می‌کند و چه چیزی را نه

Retexta، اپلیکیشن ابری اندروید برای تبدیل صدا به متن و نوشتن با هوش مصنوعی، اول صدا را به متن تبدیل می‌کند و بعد می‌تواند آن را بازنویسی کند. زبان گفتار را خودش تشخیص می‌دهد و فارسی در فهرستش هست. منوهای Retexta انگلیسی است و رابط فارسی ندارد؛ نام دکمه‌ها را به همان شکل آورده‌ایم. بازنویسی چیزهایی را که متن خام را سخت‌خوان می‌کنند خوب درست می‌کند:

  • نشانه‌گذاری و پاراگراف‌بندی؛
  • کلمه‌های پرکننده و شروع‌های اشتباه («خب، اِم، یعنی»)؛
  • عبارت‌های تکراری و جمله‌های شکسته.

اگر فقط می‌خواهید متن مرتب شود، هدف Clean up a text (زیر More templates) در اپلیکیشن این‌طور توضیح داده شده: متن شما را نگه می‌دارد و دستور زبان، نشانه‌گذاری و روانی را درست می‌کند. هدف‌های نوشتن، مثل Write a message یا Take notes، جلوتر می‌روند و حرف‌هایتان را از نو سازمان می‌دهند.

آنچه بازنویسی نمی‌تواند این است که بفهمد «شایان» به‌جای «شایگان» شنیده شده، یا «پانزده» باید «پنجاه» می‌بود. حتی ممکن است کلمه اشتباه را در جمله‌ای روان بنشاند که درست به نظر برسد. پس نام‌ها، عددها، تاریخ‌ها و مبلغ‌ها را با ضبط مقایسه کنید. Retexta روی نتیجه‌ها می‌نویسد «AI-generated. Check important details.».

دو جزئیات اپلیکیشن که به دقت کمک می‌کند: Retexta زبان گفتار را خودکار تشخیص می‌دهد، پس ضبطی که با یک جمله کامل شروع شود اطلاعات بیشتری از یک کلمه تنها به آن می‌دهد. و اگر ضبط بی‌صدا یا خیلی کم‌صدا باشد، به‌جای برگرداندن متن همین را می‌گوید («Transcription finished, but no text was produced»).

Retexta را می‌توانید رایگان امتحان کنید: کاربران جدید چند نتیجه Pro رایگان می‌گیرند که فقط داخل اپلیکیشن دیده می‌شوند، و بعد از آن‌ها Transcript only هم به Retexta Pro یا اعتبار نیاز دارد. هدف‌های بازنویسی و Import audio جزو Retexta Pro هستند، و کپی، اشتراک‌گذاری یا خروجی گرفتن نتیجه به Retexta Pro یا اعتبار نیاز دارد. خرید از طریق Google Play انجام می‌شود؛ بررسی نکرده‌ایم که این خرید در همه کشورها ممکن باشد.

ادامه مطلب

یادداشت صوتی ضبط می‌کنید؟ تبدیل فایل صوتی ضبط‌شده به متن در اندروید. به‌جای تایپ، دیکته می‌کنید؟ نوشتن ایمیل با صدا در اندروید. دو صدا در یک ضبط: پیاده‌سازی مصاحبه ضبط‌شده. فرمت فایل‌ها: تبدیل فایل MP3 به متن. درباره اپلیکیشن: Retexta، تبدیل صدا به متن برای اندروید.

منابع

بررسی‌شده توسط FLAME Apps در 25 سپتامبر 2026.

  • Google Cloud، Best practices, Cloud Speech-to-Text (به انگلیسی، آخرین به‌روزرسانی 18 سپتامبر 2026): جای میکروفون، بریده شدن صدا، نرخ نمونه‌برداری، کدک‌های بدون افت، نبودن کنترل بهره و کاهش نویز، راهنمایی واژه و عبارت. این‌ها توصیه‌های گوگل برای سرویس خودش است.
  • Wikipedia، Word error rate (به انگلیسی): تعریف WER = (S + D + I) / N.
  • کد اپلیکیشن Retexta (اندروید، نسخه 2026.1.23): تشخیص خودکار زبان (RecordScreen.kt، TranscriptionLanguageCatalog.kt)، توضیح هدف Clean up a text و پیام‌های خطا (رشته‌های اپلیکیشن).
پرسش‌ها

خوب است بدانید

چطور تبدیل صدا به متن را دقیق‌تر کنم؟

از صدا شروع کنید: میکروفون را نزدیک گوینده بگیرید، از سروصدا دور شوید و بگذارید هر بار یک نفر حرف بزند. جمله‌های کامل با سرعت یکنواخت بگویید، نام‌ها را واضح بگویید و مطمئن شوید ابزار روی زبانی که حرف می‌زنید تنظیم است.

چرا تایپ صوتی فارسی اشتباه می‌نویسد؟

علت‌های رایج: میکروفون دور یا محیط پرسروصدا، زبان تنظیم‌شده اشتباه، جابه‌جا شدن بین فارسی و انگلیسی وسط جمله، نام‌ها و اصطلاح‌های کم‌کاربرد، و حرف زدن هم‌زمان چند نفر. تفاوت فارسی گفتاری و نوشتاری هم باعث می‌شود متن به شکلی بیاید که انتظارش را نداشتید.

دقت تبدیل صدا به متن چطور اندازه‌گیری می‌شود؟

معیار رایج نرخ خطای کلمه (WER) است: مجموع کلمه‌های جایگزین‌شده، حذف‌شده و اضافه‌شده تقسیم بر تعداد کلمه‌های یک متن مرجع درست. نسخه کوچکش را خودتان می‌توانید انجام دهید: یک بند مشخص را بخوانید و اشتباه‌ها را بشمارید.

هوش مصنوعی می‌تواند اشتباه‌های تبدیل صدا به متن را درست کند؟

بازنویسی هوش مصنوعی نشانه‌گذاری، کلمه‌های پرکننده و جمله‌های شکسته را خوب درست می‌کند. اما نمی‌داند یک نام یا عدد اشتباه شنیده شده، و ممکن است اشتباه را طوری صاف کند که درست به نظر برسد. نام‌ها، عددها و تاریخ‌ها را با صدا مقایسه کنید.

دریافت اپلیکیشن

Retexta: تبدیل صدا به متن

هر طور راحتید حرف بزنید و یک ایمیل مرتب، صورتجلسه یا پیام آماده تحویل بگیرید.

برای گوشی‌ها و تبلت‌های Android.

دریافت از Google Play
برای نصب روی گوشی Android، کد را اسکن کنید

دانلود رایگانبیش از 50 زبان

منوهای اپلیکیشن به زبان انگلیسی است. می‌توانید فارسی حرف بزنید و متنتان را به فارسی یا هر یک از بیش از 50 زبان دیگر بگیرید.