GPT
D

dolly_hhrlhf

קוד פתוח

mosaicmlcc-by-sa-3.02023-05-02

המאגר מחבר בין הדאטהסט של דולי לבין שיחות מסוננות מתוך אנתרופיק. הוא נועד לאימון מודלים על הוראות קצרות ונקיות, עם היתר לשימוש מסחרי בכפוף לתנאי הרישיון.

  • 871הורדות בחודש
  • 112לייקים

מה זה

המאגר מאחד שני מקורות שונים לכדי סט נתונים אחד של מעקב אחר הוראות. החלק הראשון מגיע מתוך dolly-15k של Databricks, שמבוסס בחלקו על ויקיפדיה. החלק השני נלקח מתוך HH-RLHF של חברת Anthropic, ועבר תהליך ניקוי קפדני. בסינון מתוך אנתרופיק נלקח רק הסיבוב הראשון של השיחה, ונחתכו החוצה כל הדגימות שבהן העוזר משתמש במילים כמו human, thank או sorry, שואל שאלות, או מדבר בגוף ראשון. המטרה היתה להפוך שיחה פתוחה לרצף פשוט וישיר של פקודה ותשובה.

מבחינת חלוקה, יש כאן פיצול מובנה לטריין ולטסט, מה שלא היה קיים במקור של דולי. סט האימון מכיל 59,310 רשומות, שמתוכן 14,814 מדולי ועוד 44,496 מתוך אנתרופיק. סט הבדיקה מכיל 5,129 דוגמאות בסך הכל, שכוללות 200 דגימות אקראיות מדולי ועוד 4,929 רשומות מסוננות מאנתרופיק.

מתאים ל

  • אימון מודלים על הוראות

    מתאים לכוונון עדין של מודלי שפה באנגלית שצריכים לספק תשובה ישירה לפקודה בלי סמול טוק.

  • בנצ'מרק והערכת מודלים

    שימוש בסט הטסט המובנה שמכיל 5,129 דוגמאות לבדיקת דיוק התשובות של מודלים קיימים.

  • חלופה מסחרית לאלפקה

    בסיס לאימון מודל קוד פתוח לשימוש מסחרי, כל עוד עומדים בדרישות הרישיון של ויקיפדיה ודולי.

איפה זה נופל

הנתונים קיימים באנגלית בלבד. אם המטרה שלכם היא מודל שמבין עברית, הדאטהסט הזה לא יעזור בכלל בלי תרגום או אימון מקדים נוסף. בנוסף, הסינון האוטומטי היה אגרסיבי למדי. העובדה שהסירו כל שימוש בגוף ראשון או שאלות הבהרה הופכת את התשובות לנוקשות וישירות מאוד, מה שלא מתאים למי שרוצה לבנות בוט שיחתי טבעי. המקורות מגיעים מ־2023 ומבוססים בין היתר על דפי ויקיפדיה, כך שאין כאן ידע עדכני מעבר לזה.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. הדאטהסט כולו באנגלית בלבד לפי הגדרות המאגר. אימון עליו לא יתרום ליכולות של מודל בשפה העברית.

האם מותר להשתמש בו לפרויקט מסחרי?

כן, אך בכפוף לרישיון CC BY-SA 3.0. הרישיון דורש מתן ייחוס למחברים ומחייב להפיץ נגזרות תחת אותו רישיון. ארגונים רבים נזהרים משימוש ברישיונות ShareAlike כדי לא לסכן קוד או מודלים פנימיים.

איך הדאטהסט הזה בהשוואה ל־Alpaca?

לפי היוצרים, הוא מעט גדול יותר ומציג איכות גבוהה יותר. ההבדל העיקרי הוא שאלפקה מוגבל ברישיון של OpenAI, בעוד שהמאגר הזה מותר בשימוש מסחרי.

למה שיחות מ־HH-RLHF נראות כאן כמו פקודות?

כי הופעל עליהן סינון מכוון שלקח רק את הצעד הראשון וזרק מילות נימוס, פניות, שאלות וגוף ראשון. זה הפך דיאלוגים מורכבים להוראות ישירות וקצרות.

איך טוענים

הנתונים יושבים בקבצי parquet סטנדרטיים ומחולקים מראש לתיקיות train ו־test, כך שטוענים אותם ישירות מ־Hugging Face בלי צורך באישור גישה מיוחד. המבנה כולל ארבעה קבצים במאגר. בגלל שמדובר בטקסט בלבד עבור משימות יצירת טקסט, אפשר להתחיל לעבוד איתו מקומית בלי דרישות זיכרון חריגות או הכנות מורכבות.

from datasets import load_dataset

ds = load_dataset("mosaicml/dolly_hhrlhf")

הרישיון

הרישיון הוא CC BY-SA 3.0. מותר להשתמש בו לצרכים מסחריים, אבל חובת השיתוף הזהה חלה כאן. אתם חייבים לתת קרדיט ל־MosaicML, ל־Databricks ולעורכי ויקיפדיה, ואם אתם משנים או מפיצים נגזרת של המאגר, אתם מחויבים לשחרר אותה תחת אותו רישיון בדיוק. ההשלכות המשפטיות של סעיף ה־ShareAlike על משקולות של מודל שאומן עליו עשויות להרתיע חברות מסוימות, וכדאי לבדוק את זה עם ייעוץ משפטי לפני שמשלבים אותו במוצר סגור.

הרישיון המלא ב־Hugging Face ↗