GPT
C

comma_v0.1_training_dataset

קוד פתוח

common-pileרישיון לא דווח2025-04-10

מאגר טקסטים מסונן ומאוחד לאימון מודלי שפה, המבוסס על מקורות פתוחים. הוא נבנה כדי לספק תשתית נתונים מוכנה לאימון מודלים של טריליון ושני טריליון טוקנים.

  • 17,381הורדות בחודש
  • 44לייקים

מה זה

המאגר מרכז 463.6 מיליארד טוקנים גולמיים שמגיעים מגרסה מסוננת של פרויקט Common Pile v0.1. המידע מחולק ליותר משלושים מקורות תוכן נפרדים, כשהמשקלים הכבדים ביותר מגיעים מרישומי פטנטים של uspto עם מעל 157 מיליארד טוקנים, קוד מ־stackv2_edu עם כמעט 68 מיליארד טוקנים, ומאמרים מדעיים מ־peS2o ו־pubmed. לצדם נכללים טקסטים משפטיים, ספרים שפורסמו לפני 1929, דיונים מ־Stack Exchange ושיחות מ־Ubuntu IRC.

הנתונים עברו שינויים קלים ואיחוד לעומת החומר הגולמי של הפרויקט המקורי. המפתחים הגדירו יחסי ערבוב שונים עבור שני שלבי אימון: שלב מרכזי שבו מקורות איכותיים כמו מאמרי arXiv ופרויקטים מגיטהאב שוכפלו עד שש פעמים כדי להגיע ליותר מטריליון טוקנים אפקטיביים, ושלב סיום שבו השתמשו רק בחלק מהמקורות בכמויות מדודות כדי לייצב את התוצאות.

מתאים ל

  • אימון מקדים למודלי שפה

    בניית מודלי שפה מאפס בסדרי גודל של טריליון עד שני טריליון טוקנים באמצעות תמהיל מקורות מוכן.

  • מחקר על דגימת נתונים

    בדיקת השפעת יחסי שכפול וערבוב מקורות בשלבי אימון שונים על ביצועי המודל הסופי.

  • אימון מודלים לתכנות ומדע

    שליפת מקורות ספציפיים כמו מאמרים אקדמיים ומאגרי קוד לטובת אימון מודלים ממוקדי תחום.

איפה זה נופל

חלק גדול מהטקסטים נשען על מסמכי פטנטים אמריקאיים וקוד, מה שיוצר הטיה מובהקת לשפה טכנית ומשפטית באנגלית. הכרטיס לא מדווח על תמיכה בעברית או בשפות שאינן אנגלית, ולפי שמות המקורות סביר מאוד שהיא נעדרת כמעט לחלוטין. בנוסף, נכללים מקורות ישנים כמו ספרים מלפני 1929 לצד תמלילי IRC היסטוריים, כך שהחומר כולל סגנונות כתיבה ארכאיים שאינם משקפים שיח מודרני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

בעמוד הדאטהסט לא מופיע רישיון כלל. ללא הצהרת רישיון מפורשת, אין היתר ברור לשימוש מסחרי, וכל שימוש כזה חושף אתכם לסיכון משפטי מול בעלי הזכויות המקוריים.

האם יש במאגר טקסטים בעברית?

הכרטיס לא מציין תמיכה בעברית. רוב המקורות מגיעים ממאגרים ממשלתיים ואקדמיים בארצות הברית, כך שהתוכן הוא כמעט בוודאות באנגלית בלבד.

איך הנתונים נאספו ונארזו?

המפתחים לקחו את הגרסה המסוננת של פרויקט Common Pile v0.1, ביצעו בה שינויים קלים ואיחדו אותה לקובצי jsonl דחוסים. החלוקה הפנימית מפרידה בין המקורות השונים כדי לאפשר שכפול לפי יחסי האימון שהוגדרו.

איך טוענים

המאגר כולל 2,050 קבצים ומאורגן בתיקיות לפי מקור המידע. הקבצים שמורים בפורמט jsonl דחוס ב־gz, מחולקים למקטעים ממוספרים. אין צורך באישור גישה מיוחד כדי להוריד אותם, אבל בגלל היקף הנתונים תצטרכו להכין מראש נפח אחסון גדול ותהליך שקורא קבצים דחוסים בזרם ישיר.

from datasets import load_dataset

ds = load_dataset("common-pile/comma_v0.1_training_dataset")

הרישיון

הרישיון לא דווח בעמוד המאגר. המשמעות היא שאין הרשאה משפטית ברורה לשימוש מסחרי, ייחוס או הפצה מחדש. אם אתם מתכננים לאמן מודל למוצר מסחרי, מדובר בסיכון משפטי שמחייב בדיקה של תנאי השימוש בכל אחד מהמקורות המרכיבים את הפרויקט המקורי.

הרישיון המלא ב־Hugging Face ↗