GPT
O

orca_dpo_pairs

קוד פתוח

HuggingFaceH4mit2023-12-28

  • dpo

זוגות העדפה בפורמט DPO שחולצו מתוך OpenOrca כדי לכוונן מודלים שפתיים. המטרה היא להקנות למודלים יכולות חשיבה והסקה שלב אחר שלב בעזרת דאטה שעבר הרחבה במודלים חזקים.

  • 2,469הורדות בחודש
  • 31לייקים

מה זה

המאגר מכיל תת קבוצה של OpenOrca המותאמת לאימון העדפות מסוג DPO. המקור הוא אוסף משימות מתוך FLAN שעבר הרחבה עם עקבות חשיבה מפורטים שנוצרו על ידי GPT 3.5 ו GPT 4, בהשראת המתודולוגיה של מאמר Orca המקורי. הדאטה מחולק לשני חלקים בלבד, כאשר החלק העיקרי לאימון מכיל 12,359 רשומות והחלק המיועד לבדיקה כולל 500 רשומות.

היוצרים מציינים שהאיסוף מבוסס על גרסאות של FLAN Collection שאוחסנו תחת conceptofmind. בגלל פערים במקורות מול המאמר המקורי, חסרו כ 1.5 מיליון נקודות נתונים ביחס לתוכנית המקורית, כולל מחסור בנתוני CoT של zero-shot, כך שמדובר במימוש חלקי שנבנה ממה שהיה זמין בפועל.

מתאים ל

  • אימון העדפות DPO

    כוונון של מודלי שפה קטנים או בינוניים בעזרת זוגות העדפה כדי לשפר את איכות התשובות.

  • שיפור יכולות הסקה

    אימון מודלים על דוגמאות עם שלבי חשיבה מפורטים לפתרון בעיות מורכבות.

  • הערכת ביצועי מודל

    בדיקת איכות התוצרים של מודל קיים מול 500 דוגמאות המבחן שנשמרו בפיצול הבדיקה.

איפה זה נופל

הטקסט כולו באנגלית בלבד ואין כאן נתונים בעברית, כך שהוא לא יעזור להתאמה לשונית מקומית. הדאטה מבוסס על פלט סינתטי של מודלי שפה, ולכן הוא נושא איתו את ההטיות, השגיאות וההזיות האפשריות של מודלי המקור. בנוסף, המפרסמים מודים במפורש שהאוסף אינו שלם ביחס למאמר של Orca, ולכן חסרות בו דוגמאות חשיבה רבות שהיו במחקר המקורי.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

המאגר כולו מוגדר באנגלית בלבד. אין בו דוגמאות בעברית ולא תמצאו בו ייצוג לשפה המקומית. לשימוש בעברית תצטרכו לתרגם את הנתונים או לפנות למאגרים ייעודיים אחרים.

מה היקף הנתונים בפועל לעומת מה שמצוין במטא דאטה?

המטא דאטה של הדף מציג טווח רחב של עשרות מיליוני רשומות, אך כרטיס המאגר מפרט חלוקה מדויקת וקטנה בהרבה. בפועל יש כאן תת קבוצה הכוללת 12,359 רשומות לאימון ועוד 500 דוגמאות לבדיקה. המספרים האלה מיועדים ספציפית לתרחיש של כוונון DPO.

האם הנתונים שלמים ביחס למאמר המקורי של Orca?

לא, היוצרים מציינים במפורש שזהו סט חלקי. חסרו להם כ 1.5 מיליון רשומות מהמקורות של FLAN Collection כדי להגיע לכמות של המאמר. הם השתמשו רק במה שהיה נגיש באופן פתוח באותה עת.

האם אפשר להשתמש בתוצרים באופן מסחרי?

הרישיון המוצהר בריפו הוא MIT, שאינו מגביל שימוש מסחרי בקוד ובקבצים עצמם. עם זאת, התוכן נוצר באמצעות מודלים של OpenAI, כך שצריך לבדוק את תנאי השירות שלהם בנוגע לשימוש בנתונים שנוצרו על ידם לצורך אימון מודלים מתחרים.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה של Hugging Face בפקודת load_dataset רגילה. הנתונים שמורים בקובצי parquet נפרדים לכל פיצול, ואין צורך בהרשאת גישה מיוחדת או באישור ידני כדי להוריד אותם. בגלל מבנה הקבצים והעיבוד, מומלץ לשקול שימוש בהזרמה אם רוצים לחסוך מקום מקומי בזמן הריצה.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/orca_dpo_pairs")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, בכפוף לשמירת הודעת זכויות היוצרים. עם זאת, מכיוון שהתוכן סונתז באמצעות מודלים של חברות חיצוניות, כדאי לוודא שאין מגבלות שימוש מסחריות שנובעות מתנאי השימוש של אותם מודלים שייצרו את המידע.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗