GPT
W

whisper-large-fa-v1

קוד פתוח

vhdmmit2025-06-11

  • transformers
  • tensorboard
  • safetensors
  • whisper
  • automatic-speech-recognition

התאמה ייעודית של מנוע התמלול מבית OpenAI לשפה הפרסית. מי שמחפש לתמלל הקלטות בפרסית מקבל כאן כלי ממוקד שאומן על דאטה ייעודי במקום להסתפק בדיוק הכללי של המקור.

  • 809Mפרמטרים
  • 3.0 GBמשקל הקבצים
  • 1,938הורדות בחודש
  • 53לייקים

מה זה

מדובר בכיול של דגם הטורבו הגדול ממשפחת וויספר, עם כ־809 מיליון פרמטרים, שהותאם ספציפית לתמלול אוטומטי של השפה הפרסית. האימון התבסס על סט נתונים ייעודי של הקלטות נקיות וארך עשרים שעות על גבי מאיץ גרפי בודד. המטרה כאן ברורה, לשפר את רמת הדיוק מול המודל המקורי, שבדרך כלל מחזיק ביצועים בינוניים בשפות שאינן אנגלית או שפות אירופיות נפוצות.

במבחן התוצאה, המפתח מדווח על שיעור שגיאות מילים של 14.07 אחוזים בבדיקה הסופית, ירידה מרמה של מעל עשרים ושניים אחוזים בתחילת התהליך. בפועל, המשמעות היא שעל כל מאה מילים שתזינו בהקלטה ברורה, בערך ארבע עשרה מילים יתומללו לא נכון או יושמטו. זה ציון סביר לטקסט כללי, אבל רחוק מלהיות מושלם אם אתם בונים על תמלול עיוור ללא עריכה אנושית.

מתאים ל

  • תמלול פודקאסטים בפרסית

    הקלטות אולפן נקיות מתאימות בדיוק לאופי האימון ומניבות תוצאות קריאות וברורות.

  • חילוץ טקסט מהודעות קוליות

    מאפשר להמיר במהירות קובצי שמע פרטיים לטקסט לצורכי חיפוש ותיוק באפליקציות.

  • בסיס לאימון מותאם אישית

    נקודת מוצא מוכנה שחוסכת שעות אימון למי שרוצה להתאים מודל לתחום מקצועי בפרסית.

איפה זה נופל

המודל אומן על אודיו נקי ומסודר בלבד, ולכן הוא מתקשה בצורה ניכרת בהקלטות שטח עם רעשי רקע, מבטאים כבדים או ניבים שונים של פרסית. נקודה בעייתית נוספת היא שאין כאן אופטימיזציה להזרמת שמע בזמן אמת. בנוסף, כמו בכל הדגמים בארכיטקטורה הזו, קיימת נטייה להזיות, כלומר המודל עלול להמציא מילים שלמות שנשמעות הגיוניות במשפט אבל לא נאמרו בפועל.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לתמלול עברית או אנגלית?

לא מומלץ בכלל. למרות שהבסיס המקורי תמך בשפות רבות, הכיול כאן התמקד כולו בפרסית וסביר להניח ששפות אחרות נפגעו בצורה משמעותית.

האם הוא מתאים לשידור חי ותמלול שיחות בזמן אמת?

לא בצורה ישירה. המפתח מציין במפורש שהכלי אינו מיועד להזרמה רציפה, אלא לעיבוד קבצי שמע קיימים במנות.

איך מריצים

כדי להריץ אותו צריך בסך הכל שורות בודדות בספריית הטרנספורמרס המוכרת בפייתון. הקבצים שוקלים שלושה גיגה־בייט, כך שכל כרטיס מסך מודרני עם שישה עד שמונה גיגה זיכרון יסחוב את ההרצה בקלות, בייחוד כשמדובר בארכיטקטורת טורבו שתוכננה מראש להיות מהירה וקלה יותר מהגרסאות המלאות הקודמות.

אם אתם מתמללים קבצים בודדים פעם ביום, החזקת שרת ייעודי היא בזבוז משאבים מוחלט. במקרה כזה כדאי לפנות לממשקי ענן לפי שימוש. לעומת זאת, אם יש לכם זרם קבוע של שיחות, הרצאות או הודעות קוליות, הרצה מקומית על שרת שלכם תיתן לכם עצמאות מלאה ושמירה על פרטיות ההקלטות.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="vhdm/whisper-large-fa-v1")
print(pipe("שלום"))

הרישיון

הפרויקט שוחרר ברישיון פתוח לחלוטין מסוג MIT. מותר לכם להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים שלכם ואפילו למכור גישה אליו בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗