GPT
T

tulu-3-sft-mixture

קוד פתוח

allenaiodc-by2024-11-08

אוסף של 939,344 דוגמאות אימון מגוונות להוראות ששימש לבניית מודלי Tulu 3. הוא מציע שילוב מוכן ומפולטר של מתמטיקה, קוד, שיחות ובטיחות במקום להרכיב תערובת לבד.

  • 64,494הורדות בחודש
  • 260לייקים

מה זה

המאגר מאגד 18 מקורות שונים לכדי תערובת אחת עבור כוונון מודלים מבוסס הוראות. המבנה של כל רשומה כולל מזהה ייחודי, רשימת הודעות שמייצגת שיחה בין משתמש לעוזר, ואת שם המקור שממנו הדוגמה נלקחה.

התוכן נשען בכבדות על נתונים סינתטיים וממוקדים. יש כאן נתחי ענק של מתמטיקה ואלגברה מסדרת Persona יחד עם NuminaMath, כתיבת קוד דרך Evol CodeAlpaca ופייתון, שיחות מציאותיות מתוך WildChat GPT-4, ותרגום והוראות רב לשוניות מתוך Aya. בנוסף משולבים בו נתוני בטיחות ומניעת פריצות דרך WildGuardMix ו־WildJailbreak לצד סטים קלאסיים כמו FLAN v2 ו־OpenAssistant Guanaco.

מתאים ל

  • כוונון מודלי שיחה

    אימון ישיר של מודלי בסיס פתוחים במטרה להפוך אותם לעוזרים שמבינים פניות מורכבות.

  • חיזוק יכולות מתמטיקה

    שימוש במאות אלפי הדוגמאות מ־Persona ו־NuminaMath כדי לשפר פתרון בעיות חישוביות.

  • אימון מודלי בטיחות

    הזנת דוגמאות מ־WildJailbreak ו־WildGuardMix כדי ללמד מודל לזהות ולדחות בקשות זדוניות.

איפה זה נופל

חלק משמעותי מהמידע מבוסס על פלטים ממודלים של צד שלישי כמו GPT-4, מה שמביא איתו את השגיאות וההטיות האופייניות ליצירה סינתטית. למרות שיש ייצוג לשפות שונות דרך Aya ודיאלקטים ערביים, עברית לא מופיעה ברשימת השפות של המאגר ולא כדאי לבנות עליו לשימושים מקומיים. מעבר לזה, תערובת הרישיונות של תתי המאגרים יוצרת סיכון משפטי ברור לפרויקטים שאינם מחקר טהור.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא מומלץ להשתמש בו ישירות למוצר כזה. המאגר עצמו מוגדר לצרכי מחקר, וחלקים בתוכו כוללים נתונים ברישיון לא מסחרי ופלטים של מודלים קנייניים. מי שרוצה שימוש מסחרי יצטרך לסנן את הדוגמאות הבעייתיות לפי שדה המקור.

האם הדאטהסט כולל תמיכה בעברית?

עברית לא רשומה בשפות של המאגר. הוא מכיל אנגלית ומגוון שפות אחרות כולל ניבים של ערבית, אך אין בו התמקדות או תיוג של נתונים בעברית.

באיזה פורמט הנתונים מגיעים וכמה רשומות יש בו?

המאגר כולל 939,344 דוגמאות שמחולקות לשישה קובצי parquet. כל דוגמה מגיעה במבנה פשוט של מזהה, מקור, ומערך הודעות שמכיל את קלט המשתמש ותשובת העוזר.

איך המידע הזה נאסף?

אלן AI אספו ושילבו 18 מאגרים קיימים וסינתטיים. חלק מהמידע נוצר באמצעות מודלים כמו GPT-4, חלקו מגיע ממאגרי הוראות ציבוריים, וחלקו מורכב מנתוני בטיחות ומחקר ייעודיים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets בלי שום צורך באישור גישה או הרשמה מוקדמת. הנתונים מחולקים לשישה קובצי parquet תחת תיקיית data, כך שמומלץ להשתמש בטעינה מוזרמת אם לא רוצים לשמור את כל המאגר בזיכרון המקומי. השדה הקריטי לעבודה הוא messages, שמגיע כבר בפורמט שיחה סטנדרטי להזנה ישירה למודל, לצד שדה source שעוזר אם רוצים לסנן מקורות מסוימים.

from datasets import load_dataset

ds = load_dataset("allenai/tulu-3-sft-mixture")

הרישיון

המאגר כולו מופץ תחת רישיון ODC-BY-1.0 שדורש ייחוס, אך המפרסמים מדגישים שחלקים מתוכו כוללים רישיונות מגבילים כמו CC-BY-NC-4.0 שאינם מסחריים ופלט ממודלים חיצוניים. המשמעות היא שהאוסף כולו מוגדר כתוצר מחקרי, ואי אפשר לקחת אותו כמו שהוא לאימון מודל מסחרי בלי להסיר קודם את המקורות הבעייתיים.

הרישיון המלא ב־Hugging Face ↗