GPT
T

the-pile-splitted

קוד פתוח

ArmelRרישיון לא דווח2023-07-30

גרסה מחולקת של The Pile שחוסכת הורדה של 800 גיגה כשצריכים רק תחום ספציפי. הקבצים מסודרים לפי 22 תת המאגרים המקוריים עם חלוקה מובנית לאימון ולבדיקה.

  • 15,786הורדות בחודש
  • 23לייקים

מה זה

המאגר לוקח את The Pile המקורי של EleutherAI, קורפוס טקסט באנגלית בנפח של 800 גיגה בייט שנועד לאימון מודלי שפה, ומארגן אותו מחדש. במקום גוש נתונים אחד שקשה לברור מתוכו, היוצר השתמש בשדה המטא דאטה pile_set_name כדי לפצל את כל הדוגמאות לעשרים ושניים תת המאגרים המקוריים שמרכיבים את הפרויקט, ביניהם ArXiv, BookCorpus2 ו־Books3.

כל רשומה במאגר כוללת את הטקסט עצמו, את שדה המטא וכן עמודת domain שמציינת לאיזה תת מאגר היא שייכת. מעבר למיון לפי מקורות, כל אחד מעשרים ושניים החלקים חולק מראש לשתי קבוצות: 97 אחוז מהנתונים מיועדים לאימון, ושלושת האחוזים הנותרים שמורים לבדיקה. המבנה הזה מאפשר לגשת ישירות לתחום ספציפי מתוך המכלול הרחב בלי צורך להוריד, לפרוס ולסנן באופן ידני את כל מאות הגיגה בייטים של הקורפוס המלא.

מתאים ל

  • אימון ממוקד לתחום מסוים

    שליפת טקסטים ייעודיים כמו מאמרי ArXiv לאימון מודל שפה לתחום ספציפי בלי להוריד 800 גיגה.

  • הערכת ביצועים על מבחן נקי

    בדיקת יכולות של מודל קיים על חלוקת המבחן של שלושת האחוזים שהופרדה מראש בכל תחום.

  • ניתוח והשוואת קורפוסים

    בחינת מאפייני טקסט והבדלים סגנוניים בין מקורות שונים מתוך עשרים ושניים התחומים שמופשטים במאגר.

איפה זה נופל

הטקסטים כולם באנגלית ומבוססים על איסוף שנעשה עבור The Pile המקורי, בלי תמיכה בשפות אחרות או בעברית. החלוקה נעשתה טכנית בלבד לפי שדות המקור, ללא סינון תוכן חדש מעבר למה שהוגדר במאגר המקורי. לא דווח כאן רישיון שימוש, מה שמייצר בעיה קשה לכל פיתוח מסחרי.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

לא דווח רישיון עבור המאגר הזה. בנוסף, הוא מכיל תת מאגרים כמו Books3 שמקורם בעייתי מבחינת זכויות יוצרים, ולכן לא מומלץ להשתמש בו לבניית מוצר מסחרי.

כמה המאגר שוקל בפועל?

המאגר המלא מבוסס על The Pile ששוקל כ־800 גיגה בייט. היתרון כאן הוא שניתן לטעון רק תת מאגר יחיד מתוך עשרים ושניים החלקים, ובכך לחסוך מקום ניכר בדיסק.

האם יש במאגר טקסטים בעברית?

לא, המאגר מוגדר ומיועד לטקסטים באנגלית בלבד. אם המטרה היא אימון או בדיקה עבור השפה העברית, המאגר הזה אינו מתאים.

מה ההבדל בינו לבין The Pile המקורי?

התוכן זהה לחלוטין לגרסה המקורית של EleutherAI. ההבדל הוא שבמקום קובץ ענק אחד, הנתונים חולקו כאן מראש לעשרים ושניים תתי מאגרים שכל אחד מהם מחולק לאימון ולבדיקה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון המזהה ושם תת המאגר שרוצים, כמו ArXiv. ברירת המחדל טוענת את כל 800 הגיגה בייט, כך שמומלץ להגדיר מראש רק את החלק הרלוונטי. הנתונים שמורים בקובצי arrow, מפוצלים ל־5,606 קבצים, והגישה אליהם חופשית לחלוטין ללא צורך באישור מיוחד.

from datasets import load_dataset

ds = load_dataset("ArmelR/the-pile-splitted")

הרישיון

למאגר הזה לא דווח רישיון. מעבר לכך שהוא כולל מקורות מורכבים כמו Books3 שנויים במחלוקת משפטית, היעדר רישיון רשמי אומר שאין אישור מפורש להשתמש בו, להפיץ אותו או לאמן עליו מודלים לשימוש מסחרי.

הרישיון המלא ב־Hugging Face ↗