GPT
W

whisper-large-v3-turbo-gguf

קוד פתוח

xkeyCmit2025-03-20

  • transformers
  • onnx
  • gguf
  • whisper
  • automatic-speech-recognition

גרסה מכווצת של מודל התמלול המוביל של אופנאיי, שמקצצת בשכבות כדי לרוץ הרבה יותר מהר. מי שצריך תמלול מדויק בלי לחכות דקות ארוכות לכל קובץ ימצא כאן פשרה מעולה.

  • 2.6 GBמשקל הקבצים
  • 14,297הורדות בחודש
  • 39לייקים
  • 32שכבות

מה זה

מדובר בהתאמה מבוססת GGUF למודל טורבו של וויספר. הבסיס הוא אותו מודל מוכר שאומן על יותר מחמישה מיליון שעות שמע, אבל כאן לקחו את הארכיטקטורה וקיצצו את שכבות הפענוח מ־32 ל־4 בלבד. בזכות המהלך הזה מקבלים מודל עם 809 מיליון פרמטרים במקום 1550 מיליון.

הקיצוץ הזה חותך את זמני הריצה משמעותית ומשאיר ירידה קטנה מאוד באיכות התמלול. הוא תומך בעשרות שפות, כולל עברית, ומסוגל לתמלל ישירות לשפת המקור או לתרגם אודיו לאנגלית. המודל פולט גם חותמות זמן ברמת המשפט או המילה, מה שהופך אותו לשימושי מיד לעבודה עם כתוביות.

מתאים ל

  • תמלול שיחות והקלטות

    הוא מציע מהירות עבודה גבוהה עם מעט שכבות פענוח, מצוין למי שמעבד שעות של פגישות ומחפש תמלול מהיר.

  • הפקת כתוביות לסרטונים

    היכולת להוציא חותמות זמן ברמת המילה מאפשרת לייצר קובצי תרגום מדויקים בלי עבודת סנכרון ידנית.

  • תרגום קולי לאנגלית

    הוא ממיר אודיו משפות זרות ישירות לטקסט באנגלית במעבר אחד, בלי צורך לחבר שני מודלים נפרדים.

איפה זה נופל

האימון נעשה על דאטה רועש ברשת, ולכן המודל נוטה להזיות כשהאודיו כולל שקט ארוך או רעשי רקע כבדים. בגלל המבנה שלו הוא עלול לפעמים להיתקע בלולאות של חזרות על אותו משפט, וצריך להגדיר לו ספי שקט וטמפרטורה כדי למנוע את זה. בנוסף, הביצועים שלו בעברית ובשפות עם מעט מידע נמוכים בהרבה מאשר באנגלית, ואי אפשר להסתמך עליו כמערכת לזיהוי דוברים או לקבלת החלטות קריטיות בלי עין אנושית.

שאלות
נפוצות

כמה המודל הזה מדויק בעברית בהשוואה לאנגלית?

באנגלית הוא מציג תוצאות קרובות מאוד למקור, אבל בעברית יש ירידה מורגשת בדיוק. מומלץ לבחון הקלטות לדוגמה מהתחום שלכם לפני שמתחייבים עליו, בעיקר בגלל סלנג ורעשי סביבה.

האם שווה לשדרג אליו מגרסת הלארג' הרגילה?

אם צוואר הבקבוק שלכם הוא זמן עיבוד או זיכרון כרטיס המסך, התשובה חיובית לחלוטין. הוא דורש כמחצית מהמשאבים ומקצר זמנים, במחיר של פגיעה קלה מאוד ברמת הדיוק.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.6 ג'יגה בייט בפורמט float16, כך שאין צורך במפלצת חומרה כדי להתחיל לעבוד. כרטיס מסך מודרני עם שמונה ג'יגה זיכרון יחזיק אותו בקלות, ואפשר לעבוד גם על מעבד רגיל עם ספריות שתומכות בקובצי GGUF אם לא לחוצים על מהירות שיא.

הריצה נתמכת ישירות דרך פייפליין סטנדרטי של טרנספורמרס, עם אפשרות לחלוקה למקטעים של 30 שניות עבור קבצים ארוכים. אם יש לכם GPU שתומך בפלאש אטנשן או בהידור מבוסס פייטרוץ', אפשר להגיע למהירות גבוהה פי ארבעה וחצי, מה שהופך את ההרצה העצמית למשתלמת מאוד מול עלויות של שירותי ענן.

ollama run hf.co/xkeyC/whisper-large-v3-turbo-gguf:model_q4_k

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו בתוך מוצר סגור בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗