GPT
P

parakeet-tdt-0.6b-v3-coreml

קוד פתוח

FluidInferencecc-by-4.02025-08-17

  • nemo
  • coreml
  • automatic-speech-recognition
  • speech
  • audio

הסבה מוכנה לפורמט Core ML של מודל תמלול קומפקטי, שמיועדת לריצה מקומית ומהירה ישירות על מכשירי אפל. הוא פותר את הצורך לשלוח הקלטות שמע לרשת ומבצע את העיבוד כולו אופליין.

  • 3.3 GBמשקל הקבצים
  • 280,833הורדות בחודש
  • 51לייקים

מה זה

מדובר במודל זיהוי דיבור מבוסס ארכיטקטורת FastConformer TDT בגודל 0.6 מיליארד פרמטרים, שהוסב לעבודה ישירה מול מנועי העיבוד של אפל דרך Core ML. FluidInference לקחו את המודל המקורי של NeMo והתאימו אותו לעיבוד מעורב על גבי המעבד והמנוע העצבי של מחשבי מק ואייפונים. הוא תומך בעשרים וחמש שפות אירופאיות שונות, כולל אנגלית, גרמנית, צרפתית וספרדית.

היתרון המרכזי כאן הוא ביצועים מול משאבים בחומרה ייעודית. במבחן שנערך על מעבד M4 Pro, המודל הציג מהירות של פי 110 מזמן אמת בתמלול מקבצים, כלומר דקת שמע שלמה מפוענחת בחצי שנייה בערך. עבור מפתחי אפל, המשמעות היא יכולת לקבל תמלול איכותי בלי להרים שרת GPU ייעודי ובלי להכביד על זיכרון המכשיר.

מתאים ל

  • תמלול מקומי בתוכנות מק

    אידיאלי לעיבוד מהיר של הקלטות ארוכות במחשב, תוך שמירה מלאה על פרטיות המידע ללא שרתים חיצוניים.

  • הכתבה קולית באפליקציות iOS

    מאפשר להמיר דיבור לטקסט ישירות במכשיר בשפות אירופאיות עם השהיה נמוכה וללא חיבור רשת.

  • עיבוד תזכירים קוליים

    מתאים למוצרים שדורשים תמלול אוטומטי של קבצי אודיו שלמים ברקע באמצעות ספריית FluidAudio.

איפה זה נופל

החיסרון הברור ביותר הוא העדר תמיכה בעברית. המודל מיועד באופן מובהק לעשרים וחמש שפות אירופאיות, וכל ניסיון להזין לו שמע בשפות אחרות יוביל לפגיעה חמורה באיכות התוצאה. בנוסף, חבילת הקבצים כוללת 88 קבצים שונים בנפח כולל של 3.3 ג'יגה בייט, שזה משקל כבד מאוד להפצה בתוך אפליקציית מובייל רגילה, והוא דורש ניהול הורדה נפרדת לאחר ההתקנה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לתמלול שיחות בעברית?

לא. המודל אומן על עשרים וחמש שפות אירופאיות בלבד, כמו אנגלית, צרפתית וגרמנית. עברית אינה נתמכת, ויוצרי המודל מבהירים שהביצועים יורדים משמעותית בשפות שאינן אירופאיות.

האם המודל מתאים להרצה על גבי שרת ענן רגיל?

הגרסה הספציפית הזו עברה אופטימיזציה ישירה ל־Core ML, פורמט שמיועד לעבודה על חומרת אפל בלבד. להרצה על שרתי לינוקס עם מעבדי Nvidia מומלץ להשתמש בגרסת NeMo הרגילה של Parakeet ולא בחבילה הזו.

איך מריצים

המודל דורש מכשיר עם מערכת macOS 14 ומעלה, מומלץ עם שבבי Apple Silicon, או מכשיר נייד עם iOS 17 ומעלה. ההרצה הפשוטה ביותר היא באמצעות ספריית Swift בשם FluidAudio שפרסמו המפתחים, אשר מנהלת את הורדת המשקלים, עיבוד השמע המוקדם ופענוח הטוקנים ישירות בקוד שלכם. קלט השמע הנדרש חייב להיות בתדר 16 קילוהרץ, ערוץ מונו בודד, במערך Float32 בתחום שבין מינוס אחת לאחת.

אם אתם מפתחים לשרתי לינוקס, ל־Android או למחשבי Windows, אין לכם מה לחפש כאן ועדיף להריץ את גרסת NeMo המקורית או לפנות ל־API חיצוני. מודל בגודל 3.3 ג'יגה בייט מצדיק הטמעה מקומית רק כשבונים אפליקציה ייעודית לאקוסיסטם של אפל ורוצים לחסוך עלויות שרתים ולשמור על פרטיות מוחלטת.

pip install -U huggingface_hub
hf download FluidInference/parakeet-tdt-0.6b-v3-coreml

הקבצים

88 קבצים במאגר, 3.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל מצוין רישיון cc-by-4.0, אך בטקסט הכרטיס המפתחים מציינים Apache 2.0. שני הרישיונות מתירים שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והפצה של המודל כחלק ממוצר סגור, בתנאי שניתן קרדיט מתאים ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗