GPT
P

prolong-data-64K

קוד פתוח

princeton-nlpרישיון לא דווח2024-10-02

  • long-context

המאגר מרכז 31 מיליארד טוקנים מעובדים ומחולקים לרצפים באורך 65,536. הוא מיועד למי שרוצה לאמן מודלים להקשר ארוך בלי לבזבז שבועות על איסוף, חיתוך ואריזה של טקסטים.

  • 54,696הורדות בחודש
  • 25לייקים

מה זה

הנתונים מחולקים לעשר תיקיות לפי מקורות מוכרים ברשת, כולם עברו טוקניזציה מראש עם הטוקנייזר של לאמה שלוש. החלקים הגדולים כוללים קוד מתוך דה סטאק שחוברו לפי מאגרים שלמים, ספרים מתוך סלים פיג׳מה, ושני מקורות מתוך פיין ווב בהיקף של 6.4 מיליארד טוקנים לכל אחד. שאר המאגר כולל נתונים מדעיים מארכייב, מתמטיקה מאופן ווב מאת׳, ויקיפדיה מדולמה, פרקי ספרי לימוד, שאלות מסטאק אקסצ׳יינג׳ ומעט נתוני הוראות מטולו שתיים.

כל רשומה היא מערך חד ממדי באורך קבוע של 65,536 מזהי טוקנים. לצד הטוקנים שמור שדה אינדקסים שמגדיר איפה כל מסמך מקורי מתחיל ומסתיים בתוך הרצף הארוך, יחד עם שיוך לתחום המקור. המבנה הזה נועד לאפשר אימון ישיר על רצפים ארוכים גם כשהטקסט המקורי היה קצר יותר ונארז יחד עם קטעים אחרים.

מתאים ל

  • אימון המשך להקשר ארוך

    הרחבת חלון ההקשר של מודלים מבוססי לאמה שלוש עד לשישים וארבעה אלף טוקנים ברצף.

  • מחקר על אריזת מסמכים

    בדיקת השפעת שרשור מסמכים קצרים לרצפים ארוכים באמצעות שדה האינדקסים המובנה.

  • אימון משולב קוד וטקסט

    אימון מודלים על תערובת מוגדרת של קוד ממאגרים שלמים יחד עם ספרות ומאמרים מדעיים.

איפה זה נופל

המאגר כולו מוגבל לאנגלית בלבד, ואין בו שום ייצוג לעברית או לשפות אחרות. הבעיה המרכזית היא התלות המוחלטת בטוקנייזר של לאמה שלוש, אם אתם מאמנים מודל עם ארכיטקטורה או מילון אחרים, המאגר הזה פשוט לא שמיש עבורכם ותצטרכו לבצע דה טוקניזציה מלאה כדי להשתמש בתוכן. בנוסף, חלקי הקוד, הספרים והמתמטיקה נשענים על מקורות קיימים עם כל ההטיות והרעשים שמאפיינים אותם, כולל חיתוכי טקסט שרירותיים שנובעים משרשור מסמכים קצרים לרצפי ענק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

עדיף להימנע מזה בשלב זה. בעמוד המאגר לא הוגדר רישיון שימוש, והנתונים נלקחו מעשרה מקורות שונים שלכל אחד מהם תנאים משלו. ללא הבהרה רשמית מפרינסטון, שימוש מסחרי חושף אתכם לסיכון משפטי.

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אם אתם מחפשים לשפר ביצועים בעברית על הקשרים ארוכים, תצטרכו להכין נתונים ייעודיים באופן עצמאי.

באיזה פורמט הנתונים מגיעים ואיך פותחים אותם?

הנתונים לא שמורים כטקסט רגיל אלא כמזהי טוקנים מקודדים בפורמט אמ די אס. כדי לקרוא אותם צריך לעבוד עם ספריית הסטרימינג של מוזאיק אם אל, ולהוריד את הקבצים במלואם בעזרת סנאפשוט דאונלוד ולא דרך ממשק הטעינה הרגיל.

האם אפשר להשתמש בטוקנים האלה לאימון מודלים שאינם לאמה שלוש?

זה לא יעבוד בצורה ישירה. הטקסט נדחס ועבר טוקניזציה ספציפית למילון המונחים של לאמה שלוש, כך ששימוש במודל עם טוקנייזר שונה ידרוש פענוח של כל הטוקנים בחזרה למילים ואריזה שלהם מחדש.

איך טוענים

לא טוענים את המאגר דרך הפקודה הרגילה של ספריית דאטהסטס. הוא דורש את הספרייה של מוזאיק אם אל לסטרימינג, ומשתמש בקבצי שארד בפורמט אמ די אס שפזורים על פני יותר משלושת אלפים ושש מאות קבצים. מורידים אותו ישירות דרך שכפול המאגר בגיט או בעזרת פונקציית סנאפשוט דאונלוד. הרשומות מגיעות כבר כמזהי טוקנים מוכנים לאימון תחת שדה אינפוט איי דיז, כך שאי אפשר לקרוא אותן ישירות כטקסט פשוט בלי להמיר אותן בחזרה בעזרת הטוקנייזר.

from datasets import load_dataset

ds = load_dataset("princeton-nlp/prolong-data-64K")

הרישיון

החוקרים מפרינסטון לא דיווחו על רישיון רשמי בעמוד המאגר. מבחינה משפטית מדובר במצב בעייתי, כי המאגר מורכב מאוסף מקורות חיצוניים כמו דה סטאק, סלים פיג׳מה וויקיפדיה, שלכל אחד מהם תנאי שימוש משלו. ללא רישיון ברור לא מומלץ להשתמש בנתונים האלה לאימון מודל מסחרי או לשחרר מוצר שמתבסס עליהם, אלא לשמור אותם למחקר פנימי בלבד עד להסדרת המעמד.

הרישיון המלא ב־Hugging Face ↗