GPT
C

CrisperWhisper2.0_large

קוד פתוח

nyralabsother2026-07-15

  • crisperwhisper
  • safetensors
  • whisper
  • speech-recognition
  • verbatim

תמלול דיבור שמפריד בין מה שנאמר מילה במילה לבין מה שהדובר התכוון להגיד. הוא מחזיר חיתוכי מילים בדיוק של מילישניות ותופס גמגומים, צחוק והיסוסים.

  • 1.5Bפרמטרים
  • 2.9 GBמשקל הקבצים
  • 18,274הורדות בחודש
  • 112לייקים

מה זה

במקום להחליט בשבילכם אם לנקות שגיאות דיבור או להשאיר אותן, יש כאן בורר מצבים מפורש. מצב ורבטים רושם גמגומים, קטיעות מילים והברות כמו אממ, ומצב כוונה מנקה את הטקסט, מתקן ניסוח ומעצב תאריכים ומספרים לקריאה שוטפת. יש גם פונקציה שמקבלת תמלול נקי קיים ומזריקה לתוכו בחזרה את ההיסוסים המקוריים מההקלטה, תוך העלאת זיהוי מילים נדירות משישה אחוזים ליותר מתשעים ושישה אחוזים.

במדד של ניירה לבדיקת שיבושי דיבור בעשר שפות, הוא מקבל ציון של 87.8 ומנצח חלופות קנייניות מוכרות. בדיוק זמני המילים הוא מגיע לסטייה של כ־30 מילישניות בדיבור מוקרא ו־41 מילישניות בשיחה טבעית, ביצועים שנשענים על אימון ייעודי של מנגנון הקשב. להקלטות ארוכות הוא מחבר חלונות באמצעות המשכיות מותנית, מה שמונע חזרות או דילוגים על מילים במעבר בין מקטעים.

מתאים ל

  • איסוף דאטה לאימון מודלי קול

    יכולת שחזור ההיסוסים ממירה טקסטים ערוכים לתמלול דיבור מדויק שמתאים לאימון דיבור מלאכותי.

  • ניתוח דיבור במחקר קליני

    הוא קולט חזרות, עצירות פתאומיות והברות גמגום בדיוק גבוה בלי להחליק אותן החוצה מהטקסט.

  • כתוביות מסונכרנות לווידאו

    סטיית זמני המילים עומדת על כ־30 מילישניות ומספקת תזמון הדוק לכל מילה שנאמרת בהקלטה.

איפה זה נופל

בכרטיס מסומנות רק שפות אנגלית וגרמנית, למרות שבבנצ'מרק מדברים על עשר שפות, ובשמונה מתוכן הבדיקה נשענה על מידע סינתטי ולא על בדיקה אנושית. אין תמיכה מתועדת בעברית, ולכן בדיבור מקומי הוא כנראה לא יתאים. בנוסף, יכולת הזרקת מילות מפתח לשמות ומונחים נדירים נעולה לחלוטין ושמורה לגרסאות הפרו המסחריות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה למוצר שמוכר מנויים?

לא ישירות מההורדה. הרישיון חופשי רק למחקר ולשימוש שאינו מסחרי, ועבור כל פעילות עסקית צריך לפנות לניירה לבס כדי להסדיר רישיון בתשלום.

איך הוא מתמודד עם הלולאות המוכרות של וויספר?

הספרייה כוללת מנגנון מובנה שמזהה ומדכא חזרות בלולאה בזמן פענוח האודיו, בלי צורך לפתח תיקונים בצד שלכם.

איך מריצים

מתקינים את חבילת crisperwhisper עם תמיכה ב־CTranslate2 ומריצים על כרטיס אנבידיה בלינוקס לקבלת פענוח ספקולטיבי. המודל שוקל 2.9 גיגה־בייט וכולל מיליארד וחצי פרמטרים על פני 32 שכבות, כך שכרטיס מסך מודרני עם 8 עד 12 גיגה זיכרון יחזיק אותו בנוחות, בטח אם מפעילים קוונטיזציה של float16 או int8. יש גם אפשרות להריץ דרך פייטרוץ' רגיל על מק או מעבד, אבל זה יהיה איטי משמעותית.

אפשר להאיץ את הריצה פי 1.3 עד 1.4 על ידי צירוף גרסת הטורבו כמודל טיוטה שמציע תווים למודל הגדול. אם אתם צריכים רק תמלול נקי סטנדרטי בלי עיתוי מדויק לכל מילה ובלי לתפוס הברות היסוס, פנייה ל־API קיים תחסוך תחזוקת שרתים.

pip install -U huggingface_hub
hf download nyralabs/CrisperWhisper2.0_large

הרישיון

המשקלים משוחררים תחת רישיון מחקרי לא מסחרי של ניירה לבס. מותר להוריד, לבדוק ולפתח מחקרים, אבל אסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או פעילות עסקית בלי לרכוש מהם רישיון ייעודי בנפרד.

הרישיון המלא בעמוד המודל ↗