GPT
G

Granary

קוד פתוח

nvidiacc-by-4.02025-05-15

  • granary
  • multilingual
  • nemo

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר ענק של תמלולים ותרגומים לאנגלית עבור 25 שפות אירופאיות. הוא מיועד למי שרוצה לאמן מודלי דיבור ולאפס שגיאות בלי לתמלל בעצמו מיליון שעות אודיו.

  • 3,515הורדות בחודש
  • 218לייקים

מה זה

המאגר מציע מטא-דאטה ומניפסטים בפורמט JSONL המתאימים לערכת הכלים של NeMo, עבור שתי משימות עיקריות: זיהוי דיבור ותרגום משפות אירופאיות לאנגלית. התוכן מתבסס על ארבעה מקורות מוכרים: YODAS-Granary, VoxPopuli, YouTube-Commons ו־LibriLight. הנתונים מחולקים לפי 25 שפות אירופאיות ולפי מקור הקורפוס, עם 76 קונפיגורציות שונות שמאפשרות לגשת לשפה בודדת או לשילובים ספציפיים.

התוויות לא נוצרו ידנית אלא באמצעות פס ייצור חישובי. קטעי הקול עברו חיתוך, בדיקת זיהוי שפה ותמלול בשני מעברים דרך Whisper-large-v3, לצד סינון הזיות ותווים פגומים. את הפיסוק והאותיות הגדולות שחזרו באמצעות מודל Qwen-2.5-7B, ואת התרגום לאנגלית יצרו עם EuroLLM-9B ולאחר מכן סיננו החוצה תוצאות באיכות נמוכה.

מתאים ל

  • אימון מודל זיהוי דיבור

    אימון מודל ASR מבוסס NeMo על עשרות אלפי שעות תמלול מסוננות בספרדית, גרמנית או צרפתית.

  • תרגום דיבור לאנגלית

    פיתוח מודלי תרגום ישיר מאודיו אירופאי לטקסט אנגלי בעזרת תוויות שעברו בדיקות עקביות.

  • בניית מאגרים לשפות חדשות

    הרצת סקריפט ה־SDP של אנבידיה שסופק במאגר כדי לייצר דאטהסט זהה לשפות שאינן אירופאיות.

איפה זה נופל

הנתונים מסתמכים כולם על תיוג אוטומטי של מודלים. אם Whisper טעה והסינון פספס, השגיאה תזלוג ישירות למודל שלכם. המאגר כולל 25 שפות אירופאיות בלבד, כך שעברית לא קיימת בו כלל. בנוסף, חובת הורדת האודיו ממקורות חיצוניים יוצרת סיכון של קישורים שבורים, שינויי גרסאות של קורפוסים ישנים, וצורך באחסון מקומי מסיבי של מאות אלפי שעות שמע בפורמטים מעורבים.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכסה 25 שפות אירופאיות בלבד, בהן אנגלית, צרפתית, גרמנית, רוסית ואוקראינית. אין בו שום תמיכה בשפות שמיות או בעברית.

האם קובצי הקול יורדים אוטומטית בהרצה?

לא, המאגר מספק אך ורק קובצי טקסט ומטא-דאטה. עליכם להוריד את קובצי האודיו עצמם מהמקורות המקוריים כמו YODAS, VoxPopuli ויוטיוב, ולסדר אותם ידנית בתיקיות המתאימות.

מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר הוא CC-BY 4.0 שמתיר שימוש מסחרי עם מתן קרדיט. יחד עם זאת, חובה לבדוק בנפרד את תנאי השימוש של קובצי האודיו המקוריים שמורידים מפרויקטים כמו YouTube-Commons.

מה הגודל של המאגר בדיסק?

המניפסטים עצמם מכילים עשרות מיליוני שורות ואינם דורשים שטח חריג. לעומת זאת, החזקת קובצי האודיו עבור כ־643 אלף שעות דיבור דורשת עשרות עד מאות טרה-בייטים של נפח אחסון.

איך טוענים

טעינת המידע נעשית דרך load_dataset של Hugging Face תוך ציון השפה או הקורפוס, או בעבודה ישירה מול קובצי ה־JSONL ב־NeMo. המאגר מכיל רק מניפסטים וטקסט, ללא קובצי האודיו עצמם. עליכם להוריד את קובצי הקול בנפרד מכל מקור, כמו VoxPopuli או LibriLight, ולסדר אותם בתיקיות במבנה קשיח של שם הקורפוס והשפה כדי שהנתיב בשדה audio_filepath יתאים. כל רשומה כוללת גם את משך הזמן בשניות, שפת המקור והיעד, מזהה הקטע והטקסט המתומלל או המתורגם.

from datasets import load_dataset

ds = load_dataset("nvidia/Granary")

הרישיון

המאגר מופץ תחת רישיון CC-BY 4.0, שמאפשר שימוש מסחרי, עריכה, אימון מודלים והפצה חופשית, כל עוד אתם נותנים ייחוס הולם ליוצרים המקוריים. אין דרישה לשתף את המודל המאומן או יצירות נגזרות תחת אותו הרישיון, אך יש לשים לב לתנאי הרישיון הנפרדים של קובצי האודיו המקוריים שאתם מורידים מהמקורות השונים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗