خوانا چه کار میکند
متنی را که میچسبانید میگیرد و یک فایل MP3 پس میدهد که کسی آن را خوانده است. الان ۳۸ صدای فارسی هست (۱۹ زن و ۱۹ مرد)، صدای بومی برای ۶۴ زبان دیگر، و امکان ساختن صدای خودتان از یک ضبط سه تا هشت ثانیهای.
چیزی که این صفحه را از بقیهٔ متنخوانهای فارسی جدا میکند، عدد است. اندازه گرفتیم و دیدیم هیچ ماشینی رقم فارسی را درست نمیخواند؛ بعد آن را درست کردیم و عددِ درستشدن را هم منتشر کردیم.
صداها از کجا میآیند
از پروژهٔ Common Voice موزیلا. آدمهای داوطلب جملههایی را خواندهاند و ضبطشان را با پروانهٔ CC0 ۱٫۰ در اختیار همه گذاشتهاند، یعنی بدون نیاز به ذکر نام. هر صدای این سایت از یک ضبط یک نفر ساخته شده است: ۳۸ صدا یعنی ۳۸ آدم متفاوت.
گویندگان را در دو گام انتخاب کردیم که عمداً از هم جدا هستند: اول کیفیت (نسبت سیگنال به نویز دستکم ۲۵ دسیبل)، بعد تنوع. برای تنوع، دامنهٔ زیر و بمی صدا را به بیست بازهٔ هماندازه از نظر تعداد آدم تقسیم کردیم و از هر بازه تمیزترین صدا را برداشتیم. اگر فقط بر پایهٔ کیفیت میچیدیم، بیست صدای اول میتوانست بیست جوان بیستساله با صدای یکسان باشد.
چرا لهجه ندارد
چون دادهاش نیست. در Common Voice فارسی، ستون لهجه برای ٪۹۸٫۸ گویندگانی که بهاندازهٔ کافی جمله خواندهاند خالی است (۱٬۷۹۵ نفر از ۱٬۸۱۷). ۲۲ نفر باقیمانده ۲۲ عبارت متفاوت نوشتهاند، هرکدام یک نفر. با این داده نمیشود گفت کدام صدا تهرانی است و کدام اصفهانی.
میشد حدس زد و ننوشت که حدس است. این کار را نکردیم. ننوشتن یک چیزِ نادانسته بهتر از نوشتن یک چیزِ ساختگی است.
چه چیزهایی را هنوز بلد نیست
- عربی، کردی و پشتو ندارد. هر سه برای یک سایت فارسی کمبود واقعیاند، ولی در بانک صدای بومی مشترک این پروژه وجود ندارند.
- عددهای بزرگ هنوز کامل نیستند: پس از تبدیل به حروف، ٪۷۵ عددها درست خوانده میشوند، اما سال چهاررقمی و مبلغ پنجرقمی از این هم کمترند. عدد دقیق هر دسته در صفحهٔ عدد هست.
- لحن و احساس قابل تنظیم نیست. صدا همانطور میخواند که مدل تصمیم بگیرد.
- فایلهای ساختهشده پس از ۲۴ ساعت پاک میشوند و بازیابی نمیشوند.
چه کسی این را نگه میدارد
خوانا یک پروژهٔ شخصی است که یک نفر آن را نگهداری میکند. شرکت نیست و در هیچ مرجع ثبتی به ثبت نرسیده است.
برای تماس: [email protected]