GPT
W

whisper-podlodka-turbo

קוד פתוח

bond005apache-2.02025-06-22

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • en

גרסה מכווננת של Whisper Turbo שמתמקדת בתמלול רוסית מדויק עם פיסוק נכון ועמידות לרעש. היא חותכת הזיות בקטעים שקטים בלי לאבד את המהירות של הדגם המקורי.

  • 809Mפרמטרים
  • 3.0 GBמשקל הקבצים
  • 1,448הורדות בחודש
  • 42לייקים

מה זה

היוצר לקח את Whisper large v3 turbo ואימן אותו מחדש על מאגרי דיבור ברוסית ובאנגלית, כולל דאטהסט ייעודי בשם Podlodka Speech והקלטות שדה עם רעשי רקע. המטרה העיקרית הייתה לפתור שתי בעיות מוכרות בארכיטקטורה הזו: הזיות של טקסט כשאין דיבור בפועל, וחוסר עקביות באותיות גדולות ובסימני פיסוק ברוסית. כדי לנקות טעויות, תהליך האימון כלל שחזור פיסוק אוטומטי וסינון הזיות באמצעות מודלים ייעודיים.

חוץ מתמלול רגיל, הוא מספק חותמות זמן ומזהה קטעים נטולי דיבור דרך טוקן מיוחד. הוא תומך גם בתרגום דיבור ישיר בין רוסית לאנגלית, אם כי התרגום מרוסית לאנגלית עובד בצורה משמעותית טוב יותר מאשר בכיוון ההפוך.

מתאים ל

  • תמלול פודקאסטים ברוסית

    הוא מאומן על דאטה ייעודי של הרצאות וכולל פיסוק ואותיות גדולות בלי צורך במודל עריכה נוסף.

  • סינון קטעים שקטים

    הוא כולל זיהוי נוכחות דיבור ומחזיר טוקן מיוחד כשיש רק רעש רקע, מה שמונע טקסט מומצא.

  • תרגום אודיו מרוסית לאנגלית

    הוא מתרגם דיבור רוסי ישירות לטקסט אנגלי במהלך אחד ומפיק פלט מדויק יחסית.

איפה זה נופל

אם אתם בונים על עברית, תשכחו מזה. הוא מיועד לרוסית ולאנגלית בלבד, וגם בין שתיהן היתרון הסטטיסטי המובהק נמדד רק בתמלול רוסית. תרגום מאנגלית לרוסית מייצר שגיאות ניכרות, והיוצר מודה במפורש שערבוב שפות באותו משפט לא נבדק כלל. הוא עדיין יורש את מגבלות הליבה של ארכיטקטורת Whisper המקורית.

שאלות
נפוצות

האם המודל הזה מתאים לעיבוד אודיו בעברית?

לא. הוא אומן וכונן ספציפית עבור רוסית ואנגלית בלבד. הרצה שלו על הקלטות בעברית תניב תוצאות שגויות או הזיות.

למה להעדיף אותו על פני Whisper Turbo הרגיל של OpenAI?

הוא עמיד בהרבה לרעשי רקע, מחזיר פיסוק תקין ברוסית וממעט להמציא טקסט בקטעים שאין בהם דיבור, תחום שבו המודל הבסיסי נוטה להיכשל לעיתים קרובות.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בחיבור עם accelerate כדי לחסוך זמן טעינה. עם 809 מיליון פרמטרים ומשקל קבצים של 3.0 גיגה בייט, כרטיס מסך ביתי מודרני עם 8 עד 12 גיגה בייט זיכרון יריץ אותו בלי להזיע, במיוחד אם מורידים את הדיוק מברירת המחדל של float32.

לזיהוי דיבור ושקט, המפתח ממליץ להתקין בנוסף את ספריית whisper lid כדי לעקוף באג בפייפליין הרגיל. אם אתם מעבדים הרצאות או פגישות ארוכות, תצטרכו להשתמש בגישת חלון נע כדי לחלק את האודיו למקטעים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="bond005/whisper-podlodka-turbo")
print(pipe("שלום"))

הרישיון

רישיון apache 2.0 מאפשר שימוש חופשי לחלוטין, כולל הטמעה במוצרים מסחריים ושינוי של הקוד והמשקלים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗