GPT
D

dolphin

קוד פתוח

QuixiAIapache-2.02023-07-01

המאגר מרכז מיליוני דוגמאות אימון מבוססות FLANv2 עם תשובות סינתטיות בניסיון לשחזר את Orca. הוא פונה למי שמחפש דאטה להוראות שעבר ניקוי מסירובים ומנגנוני יישור מובנים.

  • 2,239הורדות בחודש
  • 434לייקים

מה זה

המאגר נבנה כניסיון שחזור פתוח למחקר Orca של מיקרוסופט, ומתבסס על שילוב של משימות מתוך FLANv2 עם השלמות סינתטיות שנוצרו על ידי GPT-4 ו־GPT-3.5. המבנה עוקב אחרי התפלגות הפרומפטים והתערובות של Orca, אך כולל את כל 75 אלף דוגמאות השרשרת המחשבתית מתוך FLAN ללא דגימה חלקית, לצד ניקוי כפילויות שהוריד את סט הנתונים של GPT-3.5 לכ־3.5 מיליון רשומות.

התוכן מחולק לקבצים לפי מקור ההשלמה. יש כאן כמיליון דוגמאות שנוצרו באמצעות GPT-4 וכשלושה וחצי מיליון דוגמאות שנוצרו באמצעות GPT-3.5. בנוסף, המפרסמים סיננו החוצה תשובות שמכילות סירובים, התחמקויות והטיות מובנות, במטרה לייצר בסיס נקי מעכבות שעליו ניתן להלביש שכבות יישור נפרדות.

מתאים ל

  • אימון מודלי הוראות כלליים

    כיוונון מודלי שפה על מיליוני דוגמאות עוקבות הוראה באנגלית לשיפור יכולת המענה הכללית.

  • שחזור מחקר Orca

    בדיקת ביצועי מודלים על בסיס דוגמאות חשיבה והסבר שנוצרו בהשראת המחקר של מיקרוסופט.

  • בסיס לאימון יישור מותאם

    אימון מודל פתוח ללא מגבלות סירוב מוקדמות כהכנה להוספת שכבת LoRA עם כללי יישור עצמאיים.

איפה זה נופל

המאגר מוגדר כלא מצונזר, כלומר הוצאו ממנו במכוון מנגנוני הסירוב והיישור הרגילים, כך שמודל שיאומן עליו ישירות עלול לייצר פלטים בעייתיים או פוגעניים ללא שכבת סינון נוספת. בנוסף, כל הנתונים באנגלית בלבד, ואין כאן ייצוג לעברית. מקור המידע הוא השלמות סינתטיות של מודלי OpenAI מאמצע 2023, על כל ההטיות וההזיות האפשריות שמגיעות איתן.

אותה משפחה

dolphin יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מוגדר ומכיל נתונים בשפה האנגלית בלבד, המבוססים על FLANv2 והשלמות של מודלי OpenAI.

האם מותר להשתמש במידע לפיתוח מוצר מסחרי?

הרישיון המדווח של המאגר עצמו הוא apache-2.0, שמתיר שימוש מסחרי. יחד עם זאת, הנתונים הם פלטים של GPT-4 ו־GPT-3.5, ומודל שתאמנו עליו יושפע גם מתנאי השימוש של מודל הבסיס שתבחרו.

מה ההבדל בין הקבצים השונים במאגר?

המאגר מופרד בעיקר בין קובצי flan1m שכוללים כמיליון דוגמאות עם תשובות מ־GPT-4, לבין קובצי flan5m שמכילים כ־3.5 מיליון דוגמאות עם תשובות מ־GPT-3.5. ישנם גם קבצים שעברו סינון כפילויות וסקריפטים להמרה לפורמט ShareGPT.

איך טוענים

את הדאטהסט טוענים ישירות דרך הספרייה של Hugging Face, תוך ציון שם הקובץ הרצוי, למשל flan1m-alpaca-uncensored.jsonl לחלק של GPT-4 או flan5m-alpaca-uncensored.jsonl לחלק של GPT-3.5. אין צורך באישור גישה מיוחד. המאגר מכיל 12 קבצים, כולל גרסאות נקיות מכפילויות, סקריפטים להמרה לפורמט ShareGPT וקבצי jsonl במבנה Alpaca.

from datasets import load_dataset

ds = load_dataset("QuixiAI/dolphin")

הרישיון

הדאטהסט מפורסם תחת רישיון apache-2.0, שמתיר שימוש מסחרי ומחקר ללא תשלום תמלוגים, בכפוף למתן ייחוס ושמירה על תנאי הרישיון המקוריים. עם זאת, אם אתם מאמנים עליו מודל, הרישיון הסופי של המשקולות ייקבע גם לפי רישיון מודל הבסיס שבו תבחרו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗