GPT
U

UltraTextbooks

קוד פתוח

Locutusquecc-by-sa-4.02024-01-31

  • math
  • code
  • science
  • synthetic

מאגר שמקבץ ספרי לימוד אנושיים וסינתטיים יחד עם קטעי קוד. מי שבונה מודל שפה ומחפש חומר לימודי מובנה ברמת הסבר גבוהה ימצא כאן שילוב ממוקד של כמה מקורות מוכרים.

  • 1,743הורדות בחודש
  • 201לייקים

מה זה

המאגר מאחד חמישה מקורות שונים מהאגינג פייס: ספרי תכנות וספרי לימוד מפרויקט open-phi, קבצים מתוך mini-peS2o ו־tiny-strange-textbooks, לצד התת-מאגר האיכותי ביותר של AutoMathText. התוצאה היא תערובת של טקסט שנכתב בידי בני אדם ותוכן שנוצר על ידי בינה מלאכותית, המכסים נושאי לימוד כלליים, מתמטיקה ושפות תכנות.

המבנה של הנתונים פשוט מאוד ומכיל עמודה אחת בלבד בשם text, שבה מופיע הטקסט המלא של הפרק או העמוד. אין כאן חלוקה מראש לולידציה או בדיקה, וכל הרשומות נמצאות בחלוקת אימון בודדת, כך שתצטרכו להפריד נתונים לבד לפני תחילת העבודה.

מתאים ל

  • אימון מקדים למודלי שפה

    חומר גלם עשיר בהסברים מפורטים ובקוד לשיפור יכולות ההסקה של מודלים.

  • הפקת תוכן למערכות למידה

    בסיס לאימון מודלים שמייצרים מבחנים, סיכומים והסברים פדגוגיים באנגלית.

  • מענה על שאלות טכניות

    כוונון עדין למשימות של פתרון בעיות קוד והבנת עקרונות מתמטיים מורכבים.

איפה זה נופל

יוצר המאגר מודה במפורש שעלולים להופיע בו חוסר דיוקים והטיות שלא זוהו בסינון. מעבר לזה, חלק ניכר מהתוכן סינתטי לחלוטין, מה שעלול להכניס הזיות לתוך מודל שמתאמן עליו. המאגר מוגבל לאנגלית ולקוד בלבד, כך שמי שמחפש חומרים בעברית לא ימצא כאן דבר. היעדר תיוג של שפת התכנות או הנושא מקשה מאוד על סינון ממוקד לפני אימון.

שאלות
נפוצות

האם יש במאגר תוכן בעברית?

לא. המאגר מכיל אך ורק טקסטים באנגלית וקטעי קוד. אם המטרה היא אימון מודל לתחום החינוך בישראל, תצטרכו לתרגם את החומר או להביא מקורות מקומיים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מתיר שימוש מסחרי, אבל דורש ייחוס ושיתוף תחת אותו רישיון точно. תנאי ה־ShareAlike עלול לכפות עליכם לשחרר את המודל המאומן תחת רישיון פתוח זהה, ולכן צוותים משפטיים רבים נמנעים ממנו במוצרים סגורים.

מה הגודל של המאגר וכמה דוגמאות יש בו?

המאגר כולל 5,523,999 רשומות שתופסות נפח של 22.3 ג'יגה-בייט. הנתונים מחולקים לעשרים וארבעה קובצי parquet, ואין צורך בבקשת אישור כדי להוריד אותם.

איך נאספו הנתונים?

היוצר איגד חמישה מאגרי מידע קיימים מהאגינג פייס, ביניהם פרויקטים של ספרי לימוד סינתטיים וספרי תכנות, לצד טקסטים מדעיים ומתמטיים מהרשת. מדובר בחיבור של מקורות קיימים ולא בסריקה עצמאית של ספרים פיזיים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה מיוחד. המאגר שוקל 22.3 ג'יגה-בייט ומחולק לעשרים וארבעה קובצי parquet, כך שמומלץ לעבוד במצב streaming אם אתם לא רוצים להוריד את כל הנפח מראש. השדה היחיד שמעניין אתכם בקריאה הוא text, ואין מטא-דאטה נוסף על מקור הקטע או נושא הפרק.

from datasets import load_dataset

ds = load_dataset("Locutusque/UltraTextbooks")

הרישיון

הרישיון הוא cc-by-sa-4.0, המאפשר שימוש מסחרי ולא מסחרי ודורש מתן קרדיט. החלק המורכב כאן הוא סעיף השיתוף הזהה, ShareAlike, שמחייב אתכם להפיץ כל יצירה נגזרת תחת אותו רישיון בדיוק. אם אתם מאמנים מודל על הנתונים האלה, ייתכן שתחויבו לפתוח אותו לציבור באותם תנאים, מה שלא מתאים לקוד סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗