GPT
T

tulu-3-sft-olmo-2-mixture

קוד פתוח

allenaiodc-by2024-11-25

תערובת כוונון הוראות של כמעט מיליון דוגמאות ששימשה לאימון מודלי OLMo 2. היא מרכזת משימות קוד, מתמטיקה, בטיחות ושיחה במבנה אחיד שמוכן ישר לעבודה.

  • 1,817הורדות בחודש
  • 61לייקים

מה זה

המאגר כולל 939,344 רשומות שמחולקות לשיחות בפורמט פניות ותשובות. כל רשומה כוללת מזהה ייחודי, רשימת הודעות בין משתמש לעוזר, ושם המקור שממנו הדוגמה נלקחה.

אלן AI אספו כאן דאטהסטים קיימים מקהילת הקוד הפתוח לצד סטים פנימיים מסדרת טולו 3. התערובת מכסה תחומים מגוונים: מעל רבע מיליון דוגמאות מתמטיקה ממקורות כמו נומינה ופרסונות שונות, קוד מבוסס פייתון וקוד אלפקה, שיחות שלמות מווילד צ'אט וגוואנאקו, נתוני בטיחות ייעודיים, וטקסט רב לשוני ממאגר איה.

אין כאן סינון מיוחד שמפורט מעבר לבחירת האוספים והמרתם למבנה הנתונים המשותף של פנייה ותשובה. החלוקה הפנימית מוגדרת לפי שדה המקור בלבד.

מתאים ל

  • אימון הוראות למודלי שפה

    כוונון ישיר של מודלי בסיס לשיחה ולמענה להוראות במגוון נושאים.

  • שיפור יכולות מתמטיקה וקוד

    חיזוק פתרון בעיות חישוביות ותכנות באמצעות מאות אלפי דוגמאות ממוקדות.

  • מחקר על תערובות נתונים

    בדיקת השפעת שילוב מקורות שונים על ביצועי המודל ומדדי הבטיחות שלו.

איפה זה נופל

אם אתם בונים על עברית, הדאטהסט הזה לא מתאים. רשימת השפות כוללת ערבית על ניביה, דנית, יוונית ושפות אחרות, אך עברית כלל אינה ברשימה. בנוסף, האוסף כולל פלטים שנוצרו על ידי מודלים של צד שלישי כמו GPT 4 דרך ווילד צ'אט, מה שמכניס הטיות של אותם מודלים ותלות בתנאי השימוש שלהם. אין בכרטיס פירוט על סינון רעלים ספציפי שבוצע מעבר לנתוני הבטיחות שנכללו כדוגמאות אימון, כך שצריך לבדוק היטב את הפלטים לפני שימוש במערכות אמיתיות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

לא מומלץ בלי לנקות חלקים ממנו קודם. הרישיון הכולל הוא ODC-BY, אבל בפנים יש תתי מאגרים מוגבלים, כולל No Robots ברישיון לא מסחרי ופלט של מודלים חיצוניים. המפרסמים מגדירים אותו ככלי למחקר בלבד.

האם יש בדאטהסט תמיכה בעברית?

לא. מטא הנתונים מפרט שפות כמו ערבית, דנית, יוונית ואחרות, אך עברית אינה חלק מהרשימה המדווחת. אם המטרה שלכם היא מודל שמבין עברית היטב, תצטרכו להוסיף מקורות חיצוניים.

איך המידע שמור ואיך טוענים אותו?

המידע מחולק לשישה קובצי פארקט סטנדרטיים. אפשר לטעון אותו ישירות דרך ספריית datasets בכל סביבת פייתון רגילה, ללא צורך בהרשמה מיוחדת או בקשת גישה.

מה ההבדל בין המאגר הזה לגרסאות טולו קודמות?

התערובת הזו נבנתה במיוחד עבור מודלי OLMo 2 של אלן AI. היא מאגדת יחד דאטהסטים ציבוריים מוכרים לצד נתוני פרסונות חדשים של טולו 3 במתמטיקה, בקוד ובבטיחות.

איך טוענים

הנתונים יושבים בשישה קובצי פארקט תחת תיקיית המידע. המאגר פתוח לגישה חופשית ואין צורך בהרשאות מיוחדות או באישור ידני כדי להוריד אותו. בזמן טעינה בספריית הנתונים של האגינג פייס, מקבלים ישירות את השדות id, messages ו־source. השדה החשוב ביותר לאימון הוא messages, שמוכן מראש להזנה כרצף שיחה של משתמש ומודל.

from datasets import load_dataset

ds = load_dataset("allenai/tulu-3-sft-olmo-2-mixture")

הרישיון

האוסף כולו מופץ תחת רישיון ODC-BY-1.0, שמחייב מתן קרדיט. עם זאת, התערובת מכילה חלקים עם רישיונות שונים. תת המאגר No Robots מוגדר תחת CC-BY-NC-4.0 האוסר שימוש מסחרי, ופלט מודלים חיצוניים כפוף למגבלות החברות שיצרו אותם. המפרסמים מציגים את המאגר לשימוש מחקרי בלבד, ולכן אימון מודל מסחרי עלול להיתקל בבעיה משפטית מול הרכיבים הלא מסחריים.

הרישיון המלא ב־Hugging Face ↗