GPT
M

Matrix

קוד פתוח

m-a-papache-2.02024-05-08

  • language model

מאגר ענק לאימון מקדים של מודלי שפה, המשלב אנגלית וסינית בהיקף של 4,690 מיליארד תוקנים. הוא מתאים למי שבונה מודל בסיס דו לשוני ומחפש תערובת רחבה של קוד, אקדמיה וטקסט רשת.

  • 17,437הורדות בחודש
  • 175לייקים

מה זה

המאגר כולל יותר מטריליון רשומות המחולקות לפי מקורות תוכן שונים. בפנים תמצאו חילוצים מפרויקט Common Crawl עם אתרים, בלוגים וחדשות, לצד מקורות עמוקים יותר כמו מאמרים אקדמיים ומחקריים במגוון תחומים, ספרים שכוללים ספרות יפה, ספרי עיון וספרי לימוד, וכן קובצי קוד.

בנוסף לטקסט הרציף, החומר מכיל מקורות ייעודיים כמו שאלות ותשובות מבוססות הוראות, חומרי לימוד ומבחנים, חדשות מעיתונות, מאמרים אנציקלופדיים ממספר פלטפורמות, ומסמכי פטנטים שמספקים תיאורים טכניים מפורטים של המצאות. כל התוכן ממוקד באנגלית ובסינית, ללא פירוט בכרטיס לגבי שלבי הסינון, הניקוי או הסרת הכפילויות שבוצעו בפועל.

מתאים ל

  • אימון מקדים של מודלים

    בניית מודלי שפה דו לשוניים באנגלית וסינית מאפס על גבי מיליארדי תוקנים ממקורות מגוונים.

  • התאמה לתחום הטכני

    חילוץ קובצי הקוד, המאמרים והפטנטים לצורך אימון מודלים ייעודיים להנדסה ומחקר.

  • אימון מבוסס משימות

    שימוש בחלקי ההוראות והבחינות לשיפור יכולות מענה על שאלות ופתרון מבחנים באנגלית ובסינית.

איפה זה נופל

החיסרון המרכזי כאן הוא חוסר שקיפות מוחלט לגבי אופן עיבוד הנתונים. כרטיס המאגר אינו מציין שיטות סינון, סינון תכנים פוגעניים או טווח תאריכים מדויק. שפות אחרות, כולל עברית, אינן קיימות כאן בכלל, כך שלפרויקטים מקומיים אין מה לחפש בו. בנוסף, ערבוב של ספרים, פטנטים ומאמרים ללא פירוט זכויות מעבר לרישיון הכולל מחייב בדיקה משפטית זהירה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא apache-2.0, שמתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים ולשלב אותם במוצרים סגורים. כל מה שנדרש מכם הוא לשמור על תנאי הייחוס של הרישיון המקורי.

האם יש במאגר נתונים בעברית?

לא, המאגר מוגדר כדו לשוני ומכיל אך ורק אנגלית וסינית. אם אתם מחפשים לאמן מודל שיבין עברית, תצטרכו לאסוף נתונים ממקורות אחרים או להוסיף קורפוס חיצוני משלכם.

כמה שוקל הדאטהסט ואיך מתמודדים עם הגודל שלו?

המאגר כולל קרוב לחמש מאות קבצים בהיקף של מעל 4,600 מיליארד תוקנים. מדובר בנפח של כמה טרה בייטים, ולכן מומלץ להזרים אותו ישירות לשרתי האימון ולא לנסות להוריד את כולו לתחנת עבודה רגילה.

איך המידע נאסף וסונן לפי המפתחים?

היוצרים ציינו את מקורות המידע, כמו אתרי אינטרנט, ספרים ופטנטים, אך לא פירטו את הצינור הטכני. אין מידע בכרטיס על כלי הסינון, הסרת רעשים, כפילויות או בקרת איכות של הטקסט.

איך טוענים

הנתונים מפוזרים על פני 496 קבצים, רובם בפורמט jsonl המחולק לחלקים ממוספרים לפי נושאים, כמו ספריות של ספרים או דגימות רשת. הגישה למאגר פתוחה ואינה דורשת אישור מיוחד, אך עקב הנפח העצום לא מורידים אותו ישירות למחשב האישי בלי תשתית אחסון מתאימה, חיבור מהיר ויכולת הזרמת נתונים ישירות לצינור האימון.

from datasets import load_dataset

ds = load_dataset("m-a-p/Matrix")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים ללא חובה לפתוח את הקוד שלכם, ובלבד שתשמרו על הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗