v4 · השופט השקוף

עמית ביקש: אם ההכרעה נשענת על מדידה אוטומטית, שתהיה מבוססת, שקופה, ועם עלות ליד כל גישה. זה העמוד שמראה בדיוק איך אנחנו מודדים, למה אפשר לסמוך על זה, וכמה כל דרך עולה.

הסקורקארד המלא

כל הציונים על אותן 90 שניות מ"לשמילי ואמילי מפסיק המנוע" (ההאזנה עצמה בעמוד v2). ארבעה מדדי משנה ומעליהם ציון-על אחד. עלות = הערכה לסיפור שלם של 10 דקות.

גרסה🎧🎯 ציון-עלזהות הקולאיכות כללית (OVRL)ניקיון רקע (BAK)בהירות דיבור (STOI)עוצמה (LUFS)💰 עלות לסיפור
0 · המקור▶ האזןייחוס1.002.763.270.83-16.1-
1 · פילטרים קלאסיים▶ האזן740.902.723.260.81-16.0חינם
2 · בידוד ענן (ElevenLabs)▶ האזן790.912.863.430.88-16.0~3.6 ש"ח
3 · מנקה AI מקומי (Resemble)▶ האזן780.902.973.750.83-16.0חינם
4 · בנייה מחדש, שיבוט נקי▶ האזן640.833.083.650.95-17.5~3.6 ש"ח
5 · בנייה מחדש, שיבוט טבעי▶ האזן720.882.953.480.89-17.1~3.6 ש"ח
הגנרטיבי שנפסל▶ האזן170.521.672.700.57-17.8חינם (ופסול)
קריאת התוצאה: בפסגה יש תיקו סטטיסטי בין 2 (בידוד ענן, 79) ל-3 (מנקה מקומי, 78). ההבדל קטן מרעש המדידה. מכיוון ש-3 חינמי, מקומי, ופרטי, הוא נשאר ברירת המחדל; 2 שווה שקילה אם באוזניים הוא נשמע טוב יותר. גרסאות הבנייה-מחדש (4-5) מקבלות איכות טכנית גבוהה אבל משלמות בזהות, בדיוק כמו שצפוי מקול מוחלף.

מה כל מדד מודד, ומי בנה אותו

1. זהות הקול (0-1)

כמה הפלט נשמע כמו אותו אדם שבהקלטה המקורית. נמדד עם resemblyzer (Resemble AI): רשת טביעת-קול מהסוג שמערכות אימות-דובר משתמשות בו. משווים את הפלט למקור, קטע-קטע, וממצעים.

למה לסמוך: זה בדיוק המדד שתפס את שתי התקלות הגדולות שלנו עד היום - השיבוט "המשופר" שנשמע פחות-עמית, והמשפר הגנרטיבי שהמציא דובר. לקח מובנה: הפרשים של פחות מ-0.02 הם רעש מדידה, לא הבדל אמיתי.

2. איכות כללית + ניקיון רקע + איכות דיבור (סולם 1-5)

DNSMOS P.835 של Microsoft Research: רשת שאומנה על מאות אלפי דירוגי מאזינים אנושיים, והיא הסטנדרט העולמי לשיפוט מנקי-רעש (זה המדד הרשמי של תחרויות ה-Deep Noise Suppression). נותנת שלושה ציונים נפרדים: איכות הדיבור עצמו (SIG), ניקיון הרקע (BAK), והרושם הכללי (OVRL).

למה לסמוך: ההפרדה בין "הדיבור נפגע" ל"הרקע נוקה" היא בדיוק מה שצריך כדי לוודא שמנקה לא הרס את הקול תוך כדי ניקוי.

3. בהירות דיבור (STOI, 0-1)

הערכת מובנות: כמה קל להבין את המילים. נמדד עם SQUIM (PyTorch/Meta) שמעריך את מדדי המעבדה הקלאסיים בלי צורך בהקלטת ייחוס נקייה.

למה לסמוך: מדד עצמאי לגמרי מה-DNSMOS, ובכל זאת שניהם הסכימו על הפסול הגנרטיבי ועל דירוג המנקים - הסכמה בין שופטים בלתי-תלויים היא הראיה הכי חזקה שיש.

4. עוצמה (LUFS)

מדידה הנדסית פשוטה (ffmpeg, תקן EBU R128): המרחק מיעד ה--16 LUFS של תוכן ילדים. לא דעה, סרגל.

איך נולד ציון-העל

שקלול גלוי של ארבעת המדדים, לפי מה שחשוב במוצר הזה: 40% זהות הקול (המוצר הוא אבא, לא קריין) · 35% איכות כללית · 15% בהירות · 10% עמידה בתקן עוצמה. המקור לא מקבל ציון-על - הוא הסרגל שכולם נמדדים מולו.

הוכחת השיטה על החומר שלנו (שלוש בדיקות שפיות שעברו):
1. מנועי הניקוי העלו את ניקיון-הרקע בלי להפיל את איכות-הדיבור - התבנית הצפויה ממנקה תקין.
2. המשפר הגנרטיבי, שנפסל אצלנו על זהות (0.52), קרס באופן בלתי-תלוי גם בכל מדדי האיכות (1.67) - שני שופטים שונים, אותו פסק דין.
3. גרסאות הבנייה-מחדש קיבלו בדיוק את הפרופיל הצפוי: איכות גבוהה, זהות נמוכה.
הגבולות של השופט (חשוב לדעת):
1. אפקטים שאתה עושה בפה (חיקוי מנוע, פסססס): מדד ניקיון-הרקע עלול לספור אותם כ"רעש" ולתגמל מנקה שמוחק אותם - שזה הפוך מהרצוי. לכן ניקיון-הרקע לעולם לא שופט לבד, וזהות-הקול שוקלת יותר.
2. עברית-אנגלית מעורבבת: המדדים שבחרנו הם כולם בלתי-תלויי-שפה (הם מודדים אקוסטיקה, לא מילים). במכוון לא השתמשנו במדדי תמלול (WER) - ראינו ש-whisper מהזה על החומר הדו-לשוני שלך.
3. ציון-העל טוב להשוואת גישות על אותו קטע; הוא לא ציון מוחלט בין סיפורים שונים.
4. האוזן שלך עדיין מחליטה בסוף - השופט קיים כדי שתצטרך להאזין רק לגמר, לא לכל השלבים.

העלויות, בפירוט

עודכן 26.7 לפי מדידת צריכה בפועל מול ה-API (במקום הערכות מהרשת, שהיו גבוהות פי 2-7).

גישהמנגנוןעלות לסיפור 10 דק'הערות
פילטרים / מנקה AI מקומי / מדדים / תמלולמקומי על המק-מיניחינםהמנקה רץ פי ~40 מזמן-אמת
בידוד ענן או בנייה-מחדש (ElevenLabs)660 קרדיטים לדקה (נמדד)~6,600 קרדיטים ≈ 3.6 ש"חמתוך מנוי Creator (~137k קרדיטים לחודש)
שכבת אפקטים11 קרדיטים לשנייה (נמדד)~250 קרדיטים ≈ 14 אגורות5-8 אפקטים לסיפור, חד-פעמי