עמית ביקש: אם ההכרעה נשענת על מדידה אוטומטית, שתהיה מבוססת, שקופה, ועם עלות ליד כל גישה. זה העמוד שמראה בדיוק איך אנחנו מודדים, למה אפשר לסמוך על זה, וכמה כל דרך עולה.
כל הציונים על אותן 90 שניות מ"לשמילי ואמילי מפסיק המנוע" (ההאזנה עצמה בעמוד v2). ארבעה מדדי משנה ומעליהם ציון-על אחד. עלות = הערכה לסיפור שלם של 10 דקות.
| גרסה | 🎧 | 🎯 ציון-על | זהות הקול | איכות כללית (OVRL) | ניקיון רקע (BAK) | בהירות דיבור (STOI) | עוצמה (LUFS) | 💰 עלות לסיפור |
|---|---|---|---|---|---|---|---|---|
| 0 · המקור | ▶ האזן | ייחוס | 1.00 | 2.76 | 3.27 | 0.83 | -16.1 | - |
| 1 · פילטרים קלאסיים | ▶ האזן | 74 | 0.90 | 2.72 | 3.26 | 0.81 | -16.0 | חינם |
| 2 · בידוד ענן (ElevenLabs) | ▶ האזן | 79 | 0.91 | 2.86 | 3.43 | 0.88 | -16.0 | ~3.6 ש"ח |
| 3 · מנקה AI מקומי (Resemble) | ▶ האזן | 78 | 0.90 | 2.97 | 3.75 | 0.83 | -16.0 | חינם |
| 4 · בנייה מחדש, שיבוט נקי | ▶ האזן | 64 | 0.83 | 3.08 | 3.65 | 0.95 | -17.5 | ~3.6 ש"ח |
| 5 · בנייה מחדש, שיבוט טבעי | ▶ האזן | 72 | 0.88 | 2.95 | 3.48 | 0.89 | -17.1 | ~3.6 ש"ח |
| הגנרטיבי שנפסל | ▶ האזן | 17 | 0.52 | 1.67 | 2.70 | 0.57 | -17.8 | חינם (ופסול) |
כמה הפלט נשמע כמו אותו אדם שבהקלטה המקורית. נמדד עם resemblyzer (Resemble AI): רשת טביעת-קול מהסוג שמערכות אימות-דובר משתמשות בו. משווים את הפלט למקור, קטע-קטע, וממצעים.
למה לסמוך: זה בדיוק המדד שתפס את שתי התקלות הגדולות שלנו עד היום - השיבוט "המשופר" שנשמע פחות-עמית, והמשפר הגנרטיבי שהמציא דובר. לקח מובנה: הפרשים של פחות מ-0.02 הם רעש מדידה, לא הבדל אמיתי.
DNSMOS P.835 של Microsoft Research: רשת שאומנה על מאות אלפי דירוגי מאזינים אנושיים, והיא הסטנדרט העולמי לשיפוט מנקי-רעש (זה המדד הרשמי של תחרויות ה-Deep Noise Suppression). נותנת שלושה ציונים נפרדים: איכות הדיבור עצמו (SIG), ניקיון הרקע (BAK), והרושם הכללי (OVRL).
למה לסמוך: ההפרדה בין "הדיבור נפגע" ל"הרקע נוקה" היא בדיוק מה שצריך כדי לוודא שמנקה לא הרס את הקול תוך כדי ניקוי.
הערכת מובנות: כמה קל להבין את המילים. נמדד עם SQUIM (PyTorch/Meta) שמעריך את מדדי המעבדה הקלאסיים בלי צורך בהקלטת ייחוס נקייה.
למה לסמוך: מדד עצמאי לגמרי מה-DNSMOS, ובכל זאת שניהם הסכימו על הפסול הגנרטיבי ועל דירוג המנקים - הסכמה בין שופטים בלתי-תלויים היא הראיה הכי חזקה שיש.
מדידה הנדסית פשוטה (ffmpeg, תקן EBU R128): המרחק מיעד ה--16 LUFS של תוכן ילדים. לא דעה, סרגל.
שקלול גלוי של ארבעת המדדים, לפי מה שחשוב במוצר הזה: 40% זהות הקול (המוצר הוא אבא, לא קריין) · 35% איכות כללית · 15% בהירות · 10% עמידה בתקן עוצמה. המקור לא מקבל ציון-על - הוא הסרגל שכולם נמדדים מולו.
עודכן 26.7 לפי מדידת צריכה בפועל מול ה-API (במקום הערכות מהרשת, שהיו גבוהות פי 2-7).
| גישה | מנגנון | עלות לסיפור 10 דק' | הערות |
|---|---|---|---|
| פילטרים / מנקה AI מקומי / מדדים / תמלול | מקומי על המק-מיני | חינם | המנקה רץ פי ~40 מזמן-אמת |
| בידוד ענן או בנייה-מחדש (ElevenLabs) | 660 קרדיטים לדקה (נמדד) | ~6,600 קרדיטים ≈ 3.6 ש"ח | מתוך מנוי Creator (~137k קרדיטים לחודש) |
| שכבת אפקטים | 11 קרדיטים לשנייה (נמדד) | ~250 קרדיטים ≈ 14 אגורות | 5-8 אפקטים לסיפור, חד-פעמי |