GPT
P

nvidia/parakeet-tdt-0.6b-v3

קוד פתוח

nvidiacc-by-4.02025-08-04

  • transformers
  • nemo
  • safetensors
  • gguf
  • parakeet_tdt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול אוטומטי מהיר ל־25 שפות אירופיות עם חלוקה מדויקת למילים וסימני פיסוק. בחירה טובה למי שצריך תמלול מקומי יעיל בלי לשלם על API חיצוני.

  • 627Mפרמטרים
  • 5.3 GBמשקל הקבצים
  • 728,749הורדות בחודש
  • 1,113לייקים

מה זה

מדובר במודל זיהוי דיבור קל משקל שמבוסס על ארכיטקטורת FastConformer יחד עם מפענח TDT. הוא נועד לקחת קובצי אודיו מונו בתדר 16kHz בפורמט wav או flac, ולפלוט מחרוזת טקסט מתומללת שכוללת כבר אותיות גדולות וסימני פיסוק. בניגוד לגרסה הקודמת שהתמקדה רק באנגלית, הגרסה הזו מתמודדת עם 25 שפות אירופיות ויודעת לזהות את השפה המדוברת לבד בלי שתצטרכו להגדיר לה מראש מה שומעים בהקלטה.

המבנה של המפענח נותן לו יתרון קצב עבודה גבוה בעיבוד אודיו ארוך. הוא מסוגל לקבל קטעים שלמים של עד 24 דקות ברצף עם מנגנון קשב מלא, או לטפל בקבצים של עד שלוש שעות באמצעות מנגנון קשב מקומי, מה שחוסך את הצורך לחתוך הקלטות לחתיכות קטנות לפני השליחה.

מתאים ל

  • תמלול הקלטות ארוכות

    מאפשר להזרים קבצים של עד שלוש שעות ברצף בלי לחתוך את האודיו לחלקים קטנים.

  • יצירת כתוביות לסרטונים

    מפיק חותמות זמן מדויקות ברמת המילה והמקטע יחד עם סימני פיסוק מובנים.

  • זיהוי שפה ותמלול אוטומטי

    מזהה לבד באיזו שפה אירופית מדובר מתוך 25 אפשרויות ומתמלל ללא הגדרה ידנית.

איפה זה נופל

הבעיה המרכזית למי שמפתח בארץ היא היעדר תמיכה בעברית. רשימת 25 השפות מוגבלת לאירופה, כולל רוסית ואוקראינית, אבל עברית או ערבית לא קיימות שם בכלל. בנוסף, בפורטוגזית המודל אומן על הניב האירופי, מה שפוגע בביצועים אם אתם מנסים לתמלל דוברים מברזיל. כדאי לזכור גם שהוא מקבל רק אודיו מונו בערוץ בודד, כך ששיחות מרובות ערוצים תצטרכו להמיר ולפצל בעצמכם מראש.

אותה משפחה

parakeet-tdt יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול הקלטות בעברית?

לא. המודל אומן על 25 שפות אירופיות בלבד, ביניהן אנגלית, ספרדית, צרפתית, גרמנית, רוסית ואוקראינית. עברית אינה נתמכת ברשימה ולא תעבוד.

איזה סוג של קובצי שמע המודל יודע לקבל?

הוא מקבל אך ורק קובצי אודיו מסוג wav או flac בערוץ בודד, כלומר מונו, שנדגמו בתדר של 16kHz. אם יש לכם קבצים בסטריאו או בפורמטים דחוסים אחרים, תצטרכו להמיר אותם לפני ההרצה.

האם אפשר להריץ אותו בלי תשתית פייתון מורכבת?

כן. אנבידיה מספקת גרסת GGUF שניתן להוריד ולהריץ ישירות דרך כלי C++ ייעודי שנקרא NeMo-Speech.cpp, מה שמאפשר הרצה קלה ומהירה יותר על המחשב.

איך מריצים

כדי להריץ אותו אצלכם יש שתי דרכים עיקריות. אפשר להשתמש בספריית NeMo הרשמית של אנבידיה בסביבת פייתון או דרך Transformers. אם רוצים לחסוך זיכרון ולרוץ בסביבה קלה, אפשר להוריד קובץ בפורמט GGUF ולהשתמש במנוע NeMo-Speech.cpp שנכתב ב־C++.

המודל כולל כ־627 מיליון פרמטרים ושוקל 5.3 גיגה בייט. בשביל הקלטות ארוכות מאוד של 24 דקות עם קשב מלא הכרטיס מציין שימוש במאיץ A100 עם 80GB זיכרון. אם אין לכם חומרה כזו ואתם לא רוצים להסתבך עם התקנת תלויות כבדות של CUDA וספריות ייעודיות, שימוש בשירות מנוהל שמחזיק את המודל יהיה פשוט בהרבה.

ollama run hf.co/nvidia/parakeet-tdt-0.6b-v3:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא CC-BY-4.0. מותר להשתמש במודל לצרכים מסחריים ופרטיים, לשנות אותו, לאמן עליו הלאה או להטמיע אותו במוצר שלכם. התנאי היחיד הוא מתן קרדיט ברור לאנבידיה כיוצרי המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗