GPT
O

OpenOrca

קוד פתוח

Open-Orcamit2023-06-15

מיליוני שאלות ממאגר פלאן עם תשובות מפורטות ממודלי GPT, שנבנו כדי לשחזר את יכולות ההסקה של מאמר אורקה. זה הבסיס שלכם כשרוצים ללמד מודל קטן לחשוב צעד אחר צעד.

  • 2,048טוקנים בהקשר
  • 24.2 GBמשקל הקבצים
  • 25,444הורדות בחודש
  • 1,591לייקים

מה זה

המאגר מכיל כמיליון תשובות שנוצרו על ידי GPT-4 וכ־3.2 מיליון תשובות מ־GPT-3.5. כל רשומה כוללת מזהה ייחודי, שאלת מקור שנלקחה מתוך תתי-מאגרים של FLAN Collection כמו niv, t0, cot או flan, הנחיית מערכת שניתנה ל־API, ואת התשובה המלאה שהתקבלה.

המטרה כאן היא שחזור של התפלגות הנתונים ממאמר Orca של מיקרוסופט, בדגש על תהליכי חשיבה מפורטים. במקום תשובות קצרות, הנתונים כוללים הסברים שנועדו להקנות למודלים קטנים יכולת פתרון בעיות מורכבות.

היוצרים מציינים שהמאגר חלקי ביחס למאמר המקורי. חסרות בו כ־1.5 מיליון דוגמאות בגלל מחסור בנתוני CoT מקוריים והסתמכות על תת-קבוצה של פלאן מ־HuggingFace, כך שיש כ־75 אלף דוגמאות CoT במקום 150 אלף.

מתאים ל

  • אימון הוראות להסקה

    כוונון עדין של מודלי שפה קטנים להסבר צעד אחר צעד על בסיס שרשראות חשיבה.

  • מענה לשאלות מטבלאות

    אימון מודלים למשימות פירוק וניתוח של שאילתות מורכבות מול נתונים מובנים.

  • סיכום ומיון טקסט

    בניית יכולות סיווג אפס דוגמאות ותמצות נרחב באמצעות דוגמאות מגוונות מפלאן.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן שום ייצוג לעברית. הנתונים מתבססים על תשובות סינתטיות של מודלי OpenAI מיוני 2023, מה שאומר שהטיות מובנות, הזיות או טעויות בנימוק של GPT-3.5 ו־GPT-4 קיימות בתוך הדאטה. בנוסף, חסרות כ־1.5 מיליון רשומות ביחס למחקר המקורי של אורקה, בעיקר בתתי-האוספים flan2021 ו־t0, כך שלא מדובר בשחזור מלא לחלוטין של הניסוי המקורי.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. כל הנתונים נאספו באנגלית בלבד מפרויקט FLAN ותשובות ה־API. אם אתם מכוונים למודל בעברית, תצטרכו לתרגם את הנתונים או להשתמש במקור אחר.

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון של המאגר הוא MIT ומאפשר שימוש מסחרי מלא. עם זאת, התשובות נוצרו באמצעות מודלים של OpenAI, שתנאי השירות שלהם מטילים הגבלות על אימון מודלים מתחרים. כדאי להביא זאת בחשבון מבחינה משפטית.

במה המאגר הזה שונה מ־FLAN הרגיל?

במקום התשובות המקוריות והקצרות של פלאן, השאלות הועברו ל־GPT-4 ול־GPT-3.5 יחד עם הנחיות מערכת. התוצאה היא תגובות ארוכות שמסבירות את תהליך הפתרון ולא רק פולטות את הפלט הסופי.

האם הקבצים כבר מחולקים לאימון ובדיקה?

לא, הנתונים מגיעים ללא חלוקה מובנית לסטים. יהיה עליכם לפצל את הרשומות בעצמכם לפני תחילת תהליך האימון.

איך מריצים

טוענים את הנתונים ישירות דרך ספריית datasets ללא צורך באישור גישה מיוחד. הקבצים שמורים בפורמט Parquet, מחולקים לפי מודל המקור: 1M-GPT4-Augmented.parquet ו־3_5M-GPT3_5-Augmented.parquet. בגלל המשקל הכבד של מיליוני שורות טקסט, מומלץ להשתמש בטעינה רציפה בסטרימינג במקום להוריד הכל לזיכרון. אין במאגר חלוקה מובנית לרכבת ומבחן, כך שתצטרכו לפצל בעצמכם. השדות המרכזיים לעבודה הם system_prompt, question ו־response.

pip install -U huggingface_hub
hf download Open-Orca/OpenOrca

הרישיון

המאגר מפורסם תחת רישיון MIT מתירני. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, ללא חובת שיתוף תחת אותו רישיון, ומחייב רק מתן קרדיט. מודל שתאמנו עליו חופשי ממגבלות רישוי הקוד הפתוח של הדאטהסט עצמו, אך עליכם לקחת בחשבון את תנאי השימוש של OpenAI שנוגעים לאימון מודלים על פלטים של מוצריהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗