GPT
P

deepmind/pg19

קוד פתוח

deepmindapache-2.02022-03-02

המאגר כולל ספרים שלמים באנגלית שפורסמו לפני שנת 1919 מתוך פרויקט גוטנברג. הוא מתאים למי שרוצה לאמן או לבחון מודלים על הקשרים ארוכים במיוחד בלי קיצוץ של אוצר מילים.

  • 6,096הורדות בחודש
  • 62לייקים

מה זה

הנתונים מורכבים מספרי קריאה שלמים שנלקחו ישירות מפרויקט גוטנברג. כל רשומה מייצגת ספר יחיד ומכילה ארבעה שדות בלבד: כותרת הספר, שנת ההוצאה, קישור לעמוד המקורי בפרויקט, וטקסט מלא. בניגוד למאגרים ישנים שבהם מילים נדירות הוחלפו בטוקן כללי, כאן השאירו את הטקסט פתוח לחלוטין. הניקוי היחיד שנעשה כולל הסרת טקסטים משפטיים של פרויקט גוטנברג והחלפת מילים פוגעניות לפי רשימת תקשורת בריטית בסימנים מיוחדים.

החלוקה הפנימית לא מאוזנת מספרית אלא מותאמת לגודל המסמכים. סט האימון כולל 28,602 ספרים, סט הוולידציה כולל 50 ספרים, וסט הבדיקה מכיל 100 ספרים בלבד. בגלל האורך של כל יצירה, המסמכים ארוכים בממוצע פי עשרים בהשוואה למאגרים כמו ויקיטקסט.

מתאים ל

  • בדיקת חלונות הקשר ארוכים

    השוואת ביצועים וחישוב מדדי מבוכה על מסמכים שלמים וארוכים במיוחד.

  • אימון מקדים למשימות היסק

    אימון ראשוני למודלים שמיועדים למשימות הבנה והיסק על טקסט עלילתי ארוך.

  • מחקר על דחיסת זיכרון במודלים

    בחינת ארכיטקטורות שמטרתן להתמודד עם זיכרון ארוך טווח בטרנספורמרים.

איפה זה נופל

הטקסטים נכתבו כולם לפני שנת 1919 ובשפה האנגלית בלבד, כך שאין כאן מילה אחת בעברית. הסגנון הלשוני ארכאי ומכיל הטיות היסטוריות ותרבותיות מובנות של אותה תקופה, והיוצרים עצמם מזהירים שלא להשתמש בו לבוטים של שיחה או למודלים כלליים לסביבת ייצור. המאגר נבנה לבדיקת ארכיטקטורות של חלונות הקשר רחבים, ולא לאיסוף עובדות או יצירת טקסט עכשווי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון אפאצ'י שתיים אפס מתיר שימוש מסחרי מלא. אתם צריכים רק לשמור על הקרדיט והעתק הרישיון המקורי במסמכים הנלווים, ואינכם מחויבים לפרסם את המודל המאומן בקוד פתוח.

כמה מקום בדיסק צריך בשביל לעבוד איתו?

ההורדה עצמה דורשת 11.74 גיגה בייט, והדאטהסט המיוצר תופס עוד 11.51 גיגה בייט. בסך הכל צריך להכין לפחות 23.25 גיגה בייט פנויים בדיסק לפני ההרצה.

האם יש במאגר טקסטים בעברית?

לא. המאגר מכיל ספרים בשפה האנגלית בלבד, ואינו כולל נתונים רב לשוניים או תרגומים.

האם החומר מתאים לבניית צ'אטבוט לשירות לקוחות?

לא מומלץ. הטקסטים נכתבו לפני יותר ממאה שנה והשפה בהם מיושנת, כך שמודל שיאומן עליהם ידבר באנגלית ארכאית שאינה מתאימה לשיחה מודרנית.

איך טוענים

טעינת המאגר מתבצעת ישירות מקוד המקור דרך סקריפט פייתון ייעודי, ללא צורך בהרשאות מיוחדות או אישור גישה מוקדם. לפני שמתחילים להוריד, חובה לפנות לפחות 23.25 גיגה בייט בדיסק, שכן קובצי המקור שוקלים 11.74 גיגה בייט והעיבוד המקומי מייצר עוד 11.51 גיגה בייט. השדה המרכזי לפעולה הוא שדה הטקסט, והוא מגיע כמחרוזת גולמית ארוכה מאוד שמכילה ספרים שלמים, כך שעיבוד הטוקנים ידרוש זיכרון עבודה משמעותי.

from datasets import load_dataset

ds = load_dataset("deepmind/pg19")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס, שמתיר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון. מודלים שאומנו עליו יכולים לשמש במוצרים מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗