GPT
L

llama-3.1-tulu-3-8b-preference-mixture

קוד פתוח

allenaiodc-by2024-11-20

מאגר של מעל 272 אלף זוגות העדפה לאימון DPO, שנועד ליישר מודלים מבוססי לאמה 3.1. הוא מאגד פלטים מעשרות מודלים מובילים כדי לשפר מעקב אחר הוראות.

  • 2,874הורדות בחודש
  • 27לייקים

מה זה

האוסף מכיל 272,898 זוגות של תשובות, ומורכב משבעה תתי-מאגרים שונים של העדפות שפותחו במכון אלן. חלק מהנתונים מבוססים על שיחות משתמשים אמיתיות ממאגר ויילדצ'אט, חלקם מגיעים מסינון מחדש של אולטרה-פידבק, ואחרים מיועדים ישירות לבדיקת היצמדות להוראות מורכבות ופרסונות. חלק מהתשובות נוצרו ישירות מהמודל עצמו בתהליך אימון, וחלקן נלקחו מריצות קודמות.

התשובות בזוגות נגזרו מעשרות מודלי שפה שונים, בהם סדרות מיסטרל, ג'מה 2, פאלקון, אינטרן-אל-אם, קוון 2.5 ומשפחת לאמה. לצדם שולבו פלטים של מודלים קנייניים חזקים כמו ג'י-פי-טי 4, ג'י-פי-טי 4-או וקלוד 3.5 סונט. החלוקה הפנימית הזו יוצרת מגוון סגנונות ורמות איכות, ששימשו את החוקרים לאימון גרסת ה־8B DPO של טולו 3 מעל מודל ה־SFT שלהם.

מתאים ל

  • אימון DPO למודלים פתוחים

    שימוש בזוגות ההעדפה כדי ליישר מודלי 8B ישירות מול תשובות איכותיות וחלשות.

  • שיפור מעקב אחר הוראות

    אימון על משימות ייעודיות לדיוק בהוראות מורכבות שמגיעות מתתי המאגרים הייעודיים.

  • מחקר על העדפות מודלים

    ניתוח השוואתי של פלטים ממודלים שונים כמו קלוד, מיסטרל וג'מה באותו הקשר.

איפה זה נופל

זהו אוסף שנתפר סביב מודלי 8B ואימון השוואתי, ולא פתרון קסם לכל בעיה. הנתונים כוללים פלטים של מודלים סגורים כמו קלוד ו־OpenAI, שחוסמים שימוש בתוצרים שלהם לאימון מתחרים ישירים. בנוסף, המאגר לא מפרט תמיכה בשפות שאינן אנגלית ולא מציג סינון שפות ייעודי, כך שהתאמתו לטקסט עברי אינה מובטחת כלל. כדאי לבדוק היטב את תאימות הפלטים לתחום שלכם לפני שמתבססים עליהם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

היוצרים מגדירים את המאגר לשימוש מחקרי ולימודי בלבד. למרות רישיון הבסיס, יש בפנים פלטים של OpenAI ו־Anthropic וכן מודלים עם תנאים מגבילים, כך ששימוש מסחרי ישיר חושף אתכם להפרת תנאי שימוש.

האם הדאטהסט מתאים לעבודה בעברית?

תיעוד המאגר לא מציין תמיכה בעברית או סינון לשפות נוספות. רוב מוחלט של הנתונים וההוראות מבוסס על אנגלית מהמודלים השונים, ולכן לא הייתי בונה עליו לאימון יכולות שפה מקומיות.

איך נאספו התשובות שבמאגר?

החוקרים שילבו שבעה מאגרי העדפות קודמים ויצרו מעל 272 אלף זוגות. התשובות הופקו ישירות ממגוון מודלים פתוחים ומסחריים, כולל מודלי Llama 3.1, Qwen 2.5, GPT-4o ו־Claude 3.5 Sonnet.

איך המאגר מאורגן טכנית להורדה?

המידע שמור בארבעה קבצי Parquet נפרדים. הטעינה נעשית בצורה ישירה דרך Hugging Face בלי צורך בהרשאה מיוחדת או אישור מול טפסים.

איך טוענים

הנתונים מחולקים לארבעה קבצי פרקט בתיקיית המידע, לצד קבצי רישיונות שונים והסברים. אפשר לטעון אותם בספריית הדאטהסטס הרגילה בפייתון ישירות מהנתיב של אלן איי איי, בלי צורך בבקשת גישה מיוחדת או באישור ידני מקדים.

המבנה כולל זוגות של תשובות שנבחרו ונפסלו לצד ההוראות שהזינו אליהן. כדאי להביא בחשבון את המורכבות של הרישיונות המצורפים במאגר עוד לפני תחילת העבודה, בייחוד אם התוכנית היא להשתמש בתוצרים מעבר למחקר אקדמי סגור.

from datasets import load_dataset

ds = load_dataset("allenai/llama-3.1-tulu-3-8b-preference-mixture")

הרישיון

המאגר מוגדר תחת רישיון ODC-BY, שדורש ייחוס בלבד. עם זאת, היוצרים מדגישים שהוא מיועד למחקר, כי חלקים מהנתונים כפופים לתנאי השימוש של Llama, Gemma, OpenAI ו־Anthropic שאוסרים שימוש מסחרי מסוים.

הרישיון המלא ב־Hugging Face ↗