GPT
C

CrisperWhisper

קוד פתוח

nyralabscc-by-nc-4.02024-08-29

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • de

המודל הזה נועד לתמלל במדויק כל מילת היסוס וגמגום באנגלית ובגרמנית, יחד עם חותמות זמן ברמת המילה, במקום להחליק את הדיבור כמו שעושה המקור.

  • 1.6Bפרמטרים
  • 3.0 GBמשקל הקבצים
  • 38,121הורדות בחודש
  • 344לייקים

מה זה

בניגוד לגרסאות הרגילות של Whisper שנוטות לייפות את הטקסט ולהשמיט קולות רקע או הברות מקוטעות, כאן המטרה היא דיוק מילולי מוחלט. הוא מזהה מילות מילוי, חזרות והיסוסים, ומוציא אותם כחלק בלתי נפרד מהתמלול. המפתחים שינו את הטוקנייזר ואימנו פונקציית לוס ייעודית על מנגנון הריכוז כדי לספק חותמות זמן חדות ומדויקות בהרבה סביב עצירות בדיבור.

במדדי תמלול מילולי ישיר, ההבדל מורגש מיד. במבחן על מאגר AMI המודל הגיע לשיעור שגיאות מילים של 8.72 לעומת 16.01 בגרסה המקורית של Whisper Large v3, ובמדד הפילוח סביב שתיקות הוא השיג ציון F1 של 0.80 לעומת 0.48 בלבד במקור. עם זאת, במאגרים שבהם הטקסט ערוך ונקי כמו Earnings22, המקור עדיין מוביל במעט עם 11.3 שגיאות לעומת 12.37.

מתאים ל

  • ניתוח דיבור ומחקר

    זיהוי מדויק של גמגומים, עצירות והברות מילוי במחקרים פונטיים.

  • כתוביות מסונכרנות בדיוק

    התאמת זמנים ברמת המילה הבודדת לסרטונים באנגלית ובגרמנית.

  • תמלול משפטי של הקלטות

    תיעוד מוחלט של כל מילה והיסוס שנאמרו במקור בלי סינון או עריכה.

איפה זה נופל

הבעיה המרכזית היא שהגרסה הזו ננטשה רשמית לטובת גרסה 2.0, ולכן אין תיקוני באגים שוטפים. בנוסף, האימון התמקד כולו באנגלית ובגרמנית בלבד. אין כאן תמיכה בעברית או בשפות אחרות, והרצה על שמע ישראלי פשוט לא תעבוד. המודל מתעקש לתעד כל היסוס, כך שאם אתם מחפשים תמלול קריא ומסודר לסיכומי פגישות, תקבלו טקסט עמוס במילות מילוי שדורש ניקוי ידני כבד.

שאלות
נפוצות

האם המודל תומך בתמלול הקלטות בעברית?

לא. המודל אומן ונבדק אך ורק על מאגרים באנגלית ובגרמנית, והמפתחים מתחייבים לביצועים בשפות אלו בלבד. הרצה של שמע בעברית תוביל לפלט שגוי לחלוטין.

למה להעדיף אותו על פני Whisper Large v3 הרגיל?

הוא מתאים כשחייבים חותמות זמן מדויקות מאוד של מילים וכאשר אסור למחוק גמגומים, שתיקות ומילות מילוי. אם אתם צריכים טקסט קריא ומסוכם, המקור של OpenAI עדיף.

האם כדאי להתחיל פרויקט חדש עם המודל הזה?

לא כדאי. המפתחים עצמם הודיעו שהגרסה הזו הוחלפה על ידי CrisperWhisper 2.0, שמציעה מהירות גבוהה בהרבה ויכולות חדשות, והם כבר לא מתחזקים את הגרסה הראשונה.

איך מריצים

המשקל עומד על כשלושה גיגהבייט והוא דורש כרטיס מסך עם לפחות שישה עד שמונה גיגהבייט זיכרון כדי לעבוד בנוחות עם עומסי זיכרון של פענוח. כדי לחלץ את מלוא הדיוק בחותמות הזמן צריך להתקין פיצול ייעודי של ספריית transformers ממאגר הגיטהאב של המפתחים, או להשתמש בחבילת crisperwhisper הרשמית שמריצה אותו.

אם אתם שוקלים להרים סביבה בעצמכם, קחו בחשבון שהמפתחים כבר הוציאו גרסה 2.0 שהיא מהירה פי שלושה עד חמישה ואינה סובלת מחוסר תחזוקה. במקרה שאין לכם צורך בתשתית מקומית מבודדת או בכוונון חומרה ספציפי, עדיף להשתמש בפתרונות API קיימים ולא לבזבז זמן על גרסה שמוגדרת רשמית כלא מתוחזקת.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="nyralabs/CrisperWhisper")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לא מסחרי עם ייחוס. מותר לכם להוריד את הקבצים, לערוך ניסויים ולבצע מחקר, אבל אסור לשלב אותו בשום שירות בתשלום, מוצר מסחרי או פעילות שמייצרת הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗