GPT
P

pile-uncopyrighted

קוד פתוח

monologyother2023-08-30

גרסה נקייה של The Pile שממנה נחתכו מקורות שנויים במחלוקת כמו ספרים ותרגומי כתוביות. היא פונה למי שרוצה לאמן מודל שפה בלי להסתבך ישירות עם תביעות יוצרים מוכרות.

  • 59,568הורדות בחודש
  • 174לייקים

מה זה

המאגר הזה הוא שכפול מנופה של The Pile המקורי, שנבנה בתגובה למאבקים משפטיים של סופרים ויוצרים נגד אימון מודלים על יצירות מוגנות. במקום לבנות מאגר מאפס, היוצר לקח את הטקסטים הקיימים והסיר לחלוטין חמישה תתי מאגרים ספציפיים: Books3, BookCorpus2, OpenSubtitles, YTSubtitles ו־OWT2.

הסינון התבסס ישירות על סעיף 7.1 במאמר המקורי של The Pile, שממפה אילו מקורות לא קיבלו היתר מפורש לשימוש באימון בינה מלאכותית. מה שנשאר בפנים מורכב משאר החלקים של המאגר המקורי, כמו מאמרים אקדמיים, קוד, שיחות רשת ותוכן ציבורי אחר שלא הוגדר כבעייתי באותו ניתוח. המאגר מחולק לקובצי אימון ממוספרים ולקובץ בדיקה ייעודי.

מתאים ל

  • אימון מודלי שפה בסיסיים

    אימון מודלים באנגלית תוך צמצום החשיפה המשפטית למאגרי ספרים פיראטיים ידועים.

  • מחקר אקדמי השוואתי

    בדיקת ההשפעה של הסרת ספרי פרוזה וכתוביות על איכות הפלט והיכולות הלשוניות של המודל.

  • בדיקות והערכת ביצועים

    שימוש בקובץ ה־test כדי למדוד ביצועים על טקסטים מגוונים ללא הדליפות של ספרי קריאה.

איפה זה נופל

ההגדרה של מה נקי מזכויות יוצרים מסתמכת כאן אך ורק על פרשנות מתוך המאמר המקורי של The Pile מ־2021. אף עורך דין לא עבר על שאר החלקים, ואי אפשר להבטיח שתוכן שנשאר במאגר, כמו דפי אינטרנט כלליים או קוד, חופשי לחלוטין מתביעות. בנוסף, הכרטיס לא מפרט שום סינון שפה, כך שרוב החומר באנגלית ואין פה מענה מובנה לעברית או בדיקות איכות עדכניות מעבר להסרת חמשת המקורות שנבחרו.

שאלות
נפוצות

האם המאגר בטוח לחלוטין לשימוש מסחרי?

לא. הרישיון מסווג כ־other והיוצר רק מחק חמישה מקורות בעייתיים לפי מאמר מ־2021. אף אחד לא ערב לכך ששאר החומר באינטרנט שנכלל בו אינו מוגן בזכויות יוצרים.

באיזה פורמט הקבצים מגיעים ואיך פותחים אותם?

הנתונים מחולקים ל־34 קבצים בפורמט jsonl.zst, כולל תיקיית train וקובץ test.zst. יש צורך בתמיכה בפענוח zstandard בקוד כדי לטעון אותם ברצף.

האם יש במאגר טקסטים בעברית?

הכרטיס לא מציין תמיכה בעברית או סינון רב-לשוני. המאגר מתבסס על The Pile המקורי, שרובו המוחלט הוא תוכן באנגלית.

מה ההבדל בין המאגר הזה ל־The Pile המקורי?

נמחקו ממנו לחלוטין חמישה מאגרי משנה: Books3, BookCorpus2, OpenSubtitles, YTSubtitles ו־OWT2. כל שאר הנתונים נשארו כפי שהיו.

איך טוענים

הנתונים יושבים בקבצי jsonl דחוסים בפורמט zst, בסך הכל 34 קבצים במאגר שכוללים חלוקה לתיקיית train וקובץ test נפרד. אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך Hugging Face. כדי לעבוד איתו צריך ספריות שמסוגלות לפתוח דחיסת zstandard תוך כדי קריאה, אחרת תצטרכו לפרוס קבצים כבדים מאוד ישירות לכונן לפני תחילת העבודה.

from datasets import load_dataset

ds = load_dataset("monology/pile-uncopyrighted")

הרישיון

הרישיון מוגדר כ־other, כלומר אין כאן רישיון קוד פתוח מוכר או הצהרה משפטית אחידה. העובדה שהוסרו קבצים עם בעיות זכויות יוצרים ידועות לא הופכת את התוצר למותר אוטומטית לשימוש מסחרי. מי שמאמן מודל על המאגר הזה לוקח על עצמו סיכון משפטי, כי המקורות הנותרים כפופים לרישיונות המקוריים שלהם שלא הוסדרו תחת חוזה מסודר אחד.

הרישיון המלא ב־Hugging Face ↗