GPT
T

the_pile_books3

קוד פתוח

defunct-datasetsmit2022-03-02

המאגר מרכז קרוב למאתיים אלף ספרים באנגלית שחולצו כטקסט נקי. חוקרים חיפשו אותו בעיקר כדי לשחזר מערכי נתונים סגורים ששימשו מודלים מובילים.

  • 366הורדות בחודש
  • 152לייקים

מה זה

הנתונים כוללים 196,640 רשומות, כשכל רשומה מייצגת ספר שלם ומורכבת משני שדות בלבד: כותרת הספר והטקסט המלא שלו. כל המידע שמור במבנה טקסט פשוט ללא תיוגים מורכבים או חלוקה לפרקים.

המקור לכל הספרים הוא האתר ביבליוטיק, משם הם נלקחו ועברו עיבוד דומה לזה שנעשה בפרויקט בוק קורפוס הפתוח. המטרה של שון פרסר, שיצר את הריכוז הזה עבור פרויקט דה פייל, הייתה לייצר חלופה פתוחה למה שחשדו שנמצא בתוך מערך בוקס 2 של אופן איי איי.

כל הרשומות יושבות תחת חלוקת אימון יחידה. הכרטיס אינו מפרט תהליכי סינון, ניקוי רעשים, הסרת פרטים אישיים או בקרת איכות שנעשו על הטקסט המקורי.

מתאים ל

  • אימון מודלי שפה באנגלית

    קריאת כמויות גדולות של טקסט רציף לבניית יכולות ניסוח והבנת הקשר בספרים.

  • משימות השלמת מילים

    אימון מודלים מסוג פיל מאסק על טקסט עשיר ומגוון מבחינה ספרותית.

  • מחקר על דליפת זכויות

    בדיקה אקדמית של מידת השינון והפליטה של ספרים מוגנים מתוך מודלים שאומנו בעבר.

איפה זה נופל

הבעיה המרכזית היא חוקית. הנתונים הוסרו בגלל הפרת זכויות יוצרים על הספרים, ולכן אי אפשר להשתמש בהם לשום מטרה מסחרית או מחקרית בטוחה. בנוסף, כל החומר הוא באנגלית בלבד ואין בו שום ייצוג לעברית.

הכרטיס מודה שאין כל מידע על הטיות, על זהות הכותבים או על תוכן פוגעני שעלול להסתתר בספרים. אי אפשר לדעת מה סונן ומה נשאר, מה שהופך אימון מודל עליו לסיכון גדול של פליטת טקסטים מוגנים או בעייתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

ממש לא. למרות שרשום רישיון אם איי טי, הדאטהסט הושבת והוסר מהרשת בדיוק בגלל תלונות על הפרת זכויות יוצרים של מחברי הספרים. שימוש בו מסכן אתכם בתביעות.

כמה שטח אחסון צריך בשבילו?

קובץ ההורדה שוקל 36.8 גיגה בייט, ולאחר פתיחה מלאה של כל קובצי הטקסט הוא תופס 100.9 גיגה בייט. תצטרכו מספיק זיכרון ומקום בדיסק כדי לטעון נפח כזה.

האם המאגר כולל ספרים בעברית?

לא. כל 196,640 הספרים במאגר נאספו באנגלית בלבד. אין בו שום תמיכה בשפות אחרות או התאמה לקהל ישראלי.

איך המידע נאסף ועובד?

הנתונים הורדו במלואם מאתר ביבליוטיק והומרו לטקסט רגיל ללא עימוד. מי שיצר אותו עשה זאת כדי לחקות את בוקס 2 של אופן איי איי, בלי לבצע סינון מעמיק של המקורות.

איך טוענים

משקל ההורדה של הקבצים עומד על 36.8 גיגה בייט, ובפריקה הטקסט תופס 100.9 גיגה בייט. המאגר מכיל שלושה קבצים, כולל סקריפט פייתון וקובץ הסבר, ומתאים למשימות מודלי שפה, יצירת טקסט והשלמת מילים חסרות.

לפני שבכלל מנסים לפנות אליו, יש בעיה טכנית מהותית: המאגר מוגדר כמושבת ואינו נגיש להורדה ישירה עקב תלונות על הפרת זכויות יוצרים. בפועל אי אפשר פשוט למשוך אותו מהשרת בלי עותק מקומי קיים.

from datasets import load_dataset

ds = load_dataset("defunct-datasets/the_pile_books3")

הרישיון

הרישיון הרשמי שמופיע בדף הוא רישיון אם איי טי, שעל הנייר מתיר שימוש מסחרי ושינויים בקוד. בפועל יש כאן סתירה מוחלטת, כי הטקסטים עצמם הם ספרים מוגנים שנלקחו ללא רשות וגרמו להשבתת המאגר. הרישיון המוצהר לא מגן מתביעות זכויות יוצרים, ולכן אסור להשתמש בזה למוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗