GPT
X

xP3x

קוד פתוח

CohereLabsapache-2.02023-05-21

מאגר ענק לאימון מודלים רב-לשוניים שמכיל בין מאה מיליון למיליארד רשומות במגוון עצום של שפות וכתבים. הוא מיועד למי שרוצה לאמן או לבחון מודל על פקודות ומשימות מורכבות מחוץ לאנגלית בלבד.

  • 45,489הורדות בחודש
  • 95לייקים

מה זה

המאגר מציע מאות תצורות שונות שמכסות מספר חסר תקדים של שפות, ניבים ושיטות כתב. הרשומות עצמן נאספו בעזרת מומחים ובאמצעות מיקור המונים, והן כוללות לא רק טקסטים בשפות טבעיות אלא גם קוד תכנות בשפות כמו פייתון וג'אווה לצד מחברות יופיטר. החלוקה הפנימית בנויה לפי שילוב של קוד שפה ומערכת כתב, למשל עברית בכתב עברי או ערבית במגוון להגים ואלפביתים שונים.

המבנה של המאגר מחולק לקובצי פרקט רבים מאוד, כשכל תצורה שפתית מקבלת נתיב משלה עם חלוקת אימון ייעודית. אין בכרטיס פירוט לגבי שלבי סינון הטקסט או בדיקות האיכות שבוצעו על הנתונים לפני האריזה, ולכן הנתונים מייצגים תערובת רחבה של מקורות אנושיים ומשימות מגוונות. הכרטיס מסווג את סוג הפעילות תחת קטגוריה כללית, מה שמעיד על שילוב של מטלות טקסט שונות ולא על משימת הערכה יחידה או צרה.

מתאים ל

  • אימון מודלים רב-לשוניים

    לימוד מודל בסיס או מודל שיחה לבצע הוראות במאות שפות וכתבים שונים.

  • אימון על משימות קוד

    שיפור יכולות הבנת ויצירת קוד באמצעות תצורות פייתון, ג'אווה ויופיטר.

  • בדיקת הכללה חוצת שפות

    בחינת היכולת של מודל להתמודד עם שפות דלות משאבים ושיטות כתב חריגות.

איפה זה נופל

הכרטיס כמעט ריק ממידע על תהליך הסינון, הטיות ידועות או רעילות בטקסטים. למרות התיוג של איסוף על ידי מומחים ומיקור המונים, אי אפשר לדעת מה טיב הנתונים בכל שפה בלי לדגום ידנית. פער האיכות בין שפות עתירות משאבים לשפות נדירות עלול להיות משמעותי, במיוחד בגלל הגודל העצום שמונע בקרה מלאה על התוכן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון הוא אפאצ'י שתיים אפס המאפשר שימוש מסחרי חופשי לחלוטין. נדרש לשמור על הודעות זכויות היוצרים אם מפיצים את הנתונים עצמם.

האם המאגר כולל עברית?

כן, יש תצורה ספציפית בשם heb_Hebr שמכילה נתונים בעברית באלפבית עברי. בנוסף קיימות תצורות יידיש שונות המשתמשות גם הן באותו הכתב.

כמה מקום נדרש כדי להוריד את הכל?

המאגר כולל קרוב למאה אלף קבצים ומאות מיליוני רשומות, כך שהורדה מלאה דורשת נפח אחסון גדול מאוד. מומלץ למשוך רק את התצורות הרלוונטיות לפרויקט שלכם במקום את המאגר כולו.

איך נאספו הנתונים?

לפי המטא-דאטה של הכרטיס, הנתונים נוצרו בשילוב של מומחים ועבודת המונים. עם זאת, אין תיעוד מפורט על אופן הגיוס או בקרת האיכות המדויקת שנעשתה.

איך טוענים

אתם טוענים תצורה ספציפית דרך הספרייה הרגילה של הגינג פייס לפי שם השפה והכתב, למשל heb_Hebr עבור עברית. המאגר פתוח לחלוטין ואינו דורש אישור גישה מראש. הוא שמור בפורמט פרקט ומכיל כמעט מאה אלף קבצים בסך הכל, כך שלא כדאי לנסות למשוך את כל המאגר בבת אחת בלי תשתית אחסון מתאימה.

from datasets import load_dataset

ds = load_dataset("CohereLabs/xP3x")

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בנתונים לצרכים מסחריים ומחקריים, לשנות אותם ולשלב אותם בכל פרויקט. החובה היחידה היא מתן קרדיט ושמירה על תנאי הרישיון המקוריים בהפצה של הקבצים עצמם, ללא הגבלה על תוצרי מודלים שאומנו עליהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗