GPT
C

ClimbLab

קוד פתוח

OptimalScaleapache-2.02025-04-18

קורפוס אימון ענק באנגלית שעבר סינון קפדני לתוכן לימודי והורדת פרסומות. מי שבונה מודל שפה מאפס ימצא כאן טקסט נקי ומוכן לעבודה בלי להסתבך עם טוקנים שמורים מראש.

  • 7,136הורדות בחודש
  • 16לייקים

מה זה

המאגר מבוסס על שילוב של שני מקורות ידועים, Nemotron-CC ו־SmolLM-Corpus, שנאספו במקור על ידי אנבידיה וסוננו מחדש. החוקרים חילקו את המידע ל־1,000 קבוצות נושאיות, הפעילו מסווג שמזהה פרסומות ומסווג שמעריך ערך לימודי, וזרקו החוצה קבוצות עם ציונים נמוכים. מה שנשאר אוגד לתוך 20 אשכולות סמנטיים שונים שמכילים בסך הכל 1.2 טריליון טוקנים.

המקור המקורי של אנבידיה שוחרר כשהוא כבר מקודד בטוקנים של gpt-2, מה שהקשה על מי שרצה לאמן עם טוקנייזר אחר. הצוות של OptimalScale לקח את הקבצים האלה, ביצע המרה הפוכה לטקסט רגיל, וארגן מחדש את החומר בתוך תיקיות של אשכולות.

מתאים ל

  • אימון מודלי שפה מאפס

    אימון מקדים של מודלים על 1.2 טריליון טוקנים מסוננים באנגלית בלי לכלוך ופרסומות.

  • אימון ממוקד נושא

    בחירת אשכולות ספציפיים מתוך 20 האשכולות הזמינים כדי לחזק ידע בתחומים מסוימים.

  • מחקר על תערובות דאטה

    בדיקת ההשפעה של חלוקה נושאית מבוססת אשכולות על ביצועי המודל הסופי.

איפה זה נופל

הטקסט כולו באנגלית בלבד, כך שהוא לא יעזור למי שמחפש נתונים בעברית או מודלים רב-לשוניים. הגרסה הזו לא מתוחזקת ולא שוחררה רשמית על ידי אנבידיה, אלא עברה תהליך פענוח מטוקנים של gpt-2 בחזרה לטקסט, מה שעלול להכניס שגיאות פענוח או שינויים קלים במבנה המקורי. בנוסף, מפרסמי הדאטהסט מצהירים במפורש שהם לא לוקחים אחריות על תוכן הטקסט, הדיוק שלו או עדכונים עתידיים.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. הדאטהסט מוגדר ומכיל טקסט בשפה האנגלית בלבד, על בסיס המקורות Nemotron-CC ו־SmolLM-Corpus.

האם מותר להשתמש בו למוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי מלא. אתם נדרשים רק לתת קרדיט ולצרף את תנאי הרישיון המקוריים.

מה ההבדל בין המאגר הזה למאגר המקורי של אנבידיה?

אנבידיה שחררו את החומר כשהוא כבר מומר לטוקנים מספריים של gpt-2. המאגר הנוכחי לקח את הטוקנים האלה, פענח אותם בחזרה לטקסט גולמי ושמר אותם בקבצי parquet, מה שמאפשר להשתמש בכל טוקנייזר שתרצו.

איך סוננו הנתונים בדאטהסט הזה?

הטקסטים חולקו תחילה ל־1,000 קבוצות לפי נושא. לאחר מכן הופעלו שני מסווגים, אחד לזיהוי פרסומות והשני להערכת ערך חינוכי, וקבוצות שקיבלו ציונים נמוכים נמחקו לחלוטין לפני החלוקה ל־20 האשכולות הסופיים.

איך טוענים

הדאטה פתוח להורדה ישירה בלי צורך בבקשת גישה או אישור מיוחד. הנתונים מחולקים ל־2,002 קבצי parquet, שמסודרים בתיקיות לפי האשכולות השונים, למשל cluster_1. תצטרכו להכין מראש שטח אחסון מסיבי, כי מדובר בטקסט שמקורו ב־1.2 טריליון טוקנים, ולטעון אותו בעזרת ספריית datasets או קריאת parquet מקומית ישירות מתוך התיקייה הרלוונטית למחקר שלכם.

from datasets import load_dataset

ds = load_dataset("OptimalScale/ClimbLab")

הרישיון

המאגר משוחרר ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי, שינוי של הקוד והנתונים והפצה חופשית שלהם, בתנאי שאתם שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף מודלים שתאמנו תחת אותו הרישיון, ואתם יכולים להשתמש במשקולות המאומנות במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗