GPT
O

OIG

קוד פתוח

laionapache-2.02023-03-05

יש כאן גם סקירה על LAION עצמו.

אוסף ענק של הוראות בפורמט אחיד לאימון מודלי שפה, שמחולק למאגר רחב להמשך קדם-אימון ולחלק מסונן יותר לכוונון עדין. הוא מתאים למי שרוצה בסיס פתוח בלי לבנות פייפליין איסוף מאפס.

  • 13,727הורדות בחודש
  • 311לייקים

מה זה

הרשומות בנויות כטקסט של שיחה עם תגיות קבועות של פניית אדם ותשובת בוט, לפעמים כהוראה בודדת ולפעמים כדיאלוג מתמשך. המאגר מכיל עשרות קבצים נפרדים שמאחדים מקורות שונים מאוד, החל מדיאלוגים מבוססי ויקיפדיה, דרך שאלות במתמטיקה מ־GSM8K, ועד שאילתות קוד פייתון, סיכומי חדשות ושיחות מפרלמנט קנדה.

האיסוף נשען על ערבוב בין מאגרים פתוחים קיימים כמו FLAN ו־P3 לבין דאטה סינתטי שנוצר באמצעות מודלים כמו UL2 ו־GPT-NeoX. חלק מהנתונים עברו סינון אוטומטי להסרת שגיאות עובדתיות ורעילות, וחלקם נלקחו ישירות מסריקות רשת, מה שמייצר הבדלי איכות גדולים בין הקבצים השונים במאגר.

מתאים ל

  • כוונון מודלים לפקודות

    שימוש בתת המאגר chip2 כדי להפוך מודל בסיס למודל שעוקב אחרי הוראות ושיחה בצורה נקייה.

  • המשך קדם-אימון

    אימון מקדים על עשרות מיליוני דוגמאות ההוראה הרחבות כדי לחשוף את המודל למגוון פורמטים ומשימות.

  • אימון על משימות היגיון

    שילוב קובצי המתמטיקה וההסברים כדי לשפר פתרון בעיות צעד אחר צעד והסבר של תשובות מורכבות.

איפה זה נופל

חלק גדול מהטקסט נוצר על ידי מודלים ישנים יחסית מ־2023, והוא כולל מידע סינתטי לצד טקסטים שנסרקו מהרשת הציבורית. הכרטיס מזהיר במפורש מפני נוכחות של ניסיונות משתמשים לייצר פלט רעיל או פוגעני, במיוחד במאגרים שמבוססים על בדיקות יריבות. כמעט כל החומר מבוסס על אנגלית ומקורות בינלאומיים, ללא התאמה לעברית. אם אתם בונים מוצר שפונה למשתמשים, תצטרכו להריץ סינון קפדני משלכם כדי למנוע הזיות ותוכן בעייתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון המוצהר של המאגר הוא Apache 2.0 שמתיר שימוש מסחרי מלא. הבעיה היא שהקבצים כוללים טקסטים מוויקיפדיה ברישיון CC-BY-SA ומידע שנסרק מהרשת תחת שימוש הוגן. לפני שאתם משלבים קבצים מסוימים באימון מסחרי, חובה לבדוק מאיזה מקור כל קובץ הגיע.

האם יש במאגר נתונים בעברית?

התיעוד בכרטיס לא מציין תמיכה בעברית או נוכחות של טקסטים בשפה זו. המקורות המפורטים מתמקדים באנגלית, כולל מאגרים כמו חדשות באנגלית, דיאלוגים מוויקיפדיה ופרוטוקולים של הפרלמנט הקנדי. לצורך אימון מודל בעברית תצטרכו להביא נתונים ייעודיים ממקור אחר.

מה ההבדל בין המאגר המלא לקובץ chip2?

המאגר המלא נועד להמשך קדם-אימון ומכיל מיליוני רשומות ברמת איכות בינונית ממקורות שונים. לעומת זאת, קובץ chip2 כולל כמאתיים אלף דוגמאות שעברו סינון איכות, בדיקות הרצה של קוד והסרת תשובות שגויות. הוא מיועד לשלב האחרון של כוונון עדין למעקב אחרי פקודות.

איך מומלץ להוריד את הנתונים לעבודה מקומית?

יוצרי המאגר ממליצים לא להשתמש בספריית datasets הרגילה כדי למשוך את הכל בבת אחת. במקום זה, עדיף להיכנס ישירות לעץ הקבצים ולהוריד רק את קובצי ה־jsonl הספציפיים שדרושים לכם. הדבר מונע הורדה של עשרות ג'יגה-בייט מיותרים ותקלות בטעינת המטא-דאטה.

איך טוענים

הנתונים יושבים ב־37 קבצי jsonl נפרדים בעמוד המאגר. היוצרים ממליצים להוריד ישירות את הקבצים הרלוונטיים ולא לטעון את הכל דרך load_dataset הרגיל של Hugging Face, בין היתר בגלל גודל המאגר והמבנה המפוצל שלו. כל רשומה כוללת שדה text שבו מופיע הדיאלוג המובנה, וחלק מהקבצים כוללים גם שדה metadata שנוסף בעדכון מאוחר יותר כדי למנוע קריסות בטעינה. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה.

from datasets import load_dataset

ds = load_dataset("laion/OIG")

הרישיון

המאגר מופץ ברישיון Apache 2.0 על החלקים שנוצרו על ידי מתנדבי LAION, ומאפשר שימוש מסחרי, שינוי והפצה בלי לחייב פתיחת קוד של המודל שלכם. עם זאת, התוכן בפנים כולל מקורות חיצוניים ברישיונות שונים כמו CC-BY-SA מוויקיפדיה ונתונים מסריקת רשת. המשמעות היא שאתם צריכים לבדוק את התנאים של כל קובץ ומקור לפני אימון מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗