GPT
S

smol

קוד פתוח

googlecc-by-4.02025-02-14

מאגר תרגום של גוגל למאות שפות עם מעט מאוד משאבים ברשת. הוא מתאים למי שרוצה לאמן או לבדוק מודלים בתרגום לשפות נדירות במיוחד.

  • 1,864הורדות בחודש
  • 121לייקים

מה זה

המאגר מציע צמדי תרגום במאות שפות שונות, כאשר הדגש המרכזי הוא על שפות בעלות נוכחות דלה ברשת העולמית. מבנה הנתונים מחולק לשלושה תתי מאגרים לפי שמות הקבצים וההגדרות: smolsent שמכיל כנראה משפטים בודדים, smoldoc שמכיל מסמכים מלאים, וכן תיקיית gatitos. החלוקה הזו מאפשרת לבחון תרגום ברמת המשפט הבודד לצד התמודדות עם הקשר רחב יותר של טקסט רציף, תלוי בצמד השפות שבוחרים לטעון.

רוב צמדי השפות בנויים סביב אנגלית כשפת מקור או יעד, אך ניתן למצוא גם צמדים המבוססים על רוסית מול שפות קווקזיות וסיביריות מקומיות. כרטיס המאגר מספק מעט מאוד פרטים טכניים על מקורות הטקסט או שיטות הסינון והניקוי. לא ידוע מאיזה אתרים או מסמכים נאסף המידע, האם נעשה שימוש בבדיקות אנושיות, או באילו מדדים ביצעו סינון אוטומטי. מדובר בחבילה גולמית של קובצי שורות שמטרתה לחזק תרגום בשפות שקשה מאוד להשיג עבורן נתונים מקבילים.

מתאים ל

  • אימון מודלי תרגום

    הרחבת יכולות התרגום של מודלים קיימים לשפות נדירות שאין להן כמעט ייצוג מקוון.

  • הערכת ביצועי שפה

    בדיקת איכות התרגום ברמת המשפט או המסמך מול שפות מקור נפוצות.

  • מחקר בלשני חישובי

    ניתוח התנהגות מודלים על שפות מעוטרות משאבים ופיתוח שיטות למידה בדאטה מוגבל.

איפה זה נופל

כרטיס המאגר לא מספק מידע על הטיות, שנת איסוף הטקסטים או מקור החומרים. חוסר התיעוד הזה מחייב אתכם לבדוק ידנית את איכות התרגום לפני שאתם משלבים את הנתונים במערכת חיה. כמו כן, אין כאן עברית כלל, שכן המאגר מתמקד כולו בשפות נדירות, להוציא שפות גשר כמו אנגלית ורוסית. ההיקף הכולל קטן יחסית, כך שחלק מהשפות כוללות כמות זעומה של דוגמאות שלא תספיק לבדה לאימון מודל מלא מאפס.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא, עברית לא נכללת ברשימת השפות של המאגר. המאגר מיועד לשפות עם מעט מאוד משאבים ברשת, לצד שפות תיווך כמו אנגלית, רוסית, צרפתית או ספרדית.

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא. הדרישה המרכזית היא מתן קרדיט מתאים לגוגל ולמחברי המאגר, וציון האם ביצעתם שינויים בנתונים.

איך מחולקים הקבצים בתוך המאגר?

הנתונים מפוצלים לקובצי jsonl לפי שפות ולפי רמת הטקסט. ישנם קבצים למשפטים בודדים תחת smolsent, מסמכים תחת smoldoc, וקבצים נוספים תחת gatitos.

האם המאגר דורש הרשמה או בקשת אישור מיוחדת?

אין שום צורך באישור מוקדם או בטופס גישה. כל 870 הקבצים זמינים להורדה חופשית ופתוחה ישירות משרתי הגינג פייס.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets על ידי ציון שם התצורה הרצויה, כמו צמד השפות והרמה המבוקשת. כל קונפיגורציה כזו מושכת קובץ jsonl בודד שמכיל את נתוני האימון. אין צורך באישור גישה או במפתח סודי כדי להוריד את הקבצים, המאגר פתוח לחלוטין לציבור.

המאגר כולו כולל 870 קבצים ומכיל בין עשרת אלפים למאה אלף רשומות בסך הכל, כך שגודל של כל קובץ ספציפי הוא קטן מאוד. בגלל המבנה המפוצל, אתם לא מורידים את הכל בבת אחת אלא בוחרים בדיוק את צמד השפות הרלוונטי למשימה שלכם, מה שחוסך מקום ומאפשר עבודה מיידית.

from datasets import load_dataset

ds = load_dataset("google/smol")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שאתם נותנים קרדיט הולם ליוצרים המקוריים ומציינים אם נעשו שינויים בנתונים. אין כאן חובת שיתוף זהה, כך שניתן לאמן מודלים על בסיס הנתונים הללו ולשמור על הקוד או המשקולות תחת רישיון סגור או מסחרי לבחירתכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗