GPT
D

dolphin-r1

קוד פתוח

QuixiAIapache-2.02025-01-30

מאגר שמחבר שמונה מאות אלף דוגמאות שיחה וחשיבה שנוצרו במטרה לאמן מודלים בסגנון דיפסיק אר אחת. אם אתם בונים מודל שמציג שרשרת חשיבה, החלוקה הפנימית כאן נותנת בסיס מוכן לעבודה.

  • 1,317הורדות בחודש
  • 304לייקים

מה זה

המאגר מכיל שמונה מאות אלף דוגמאות שנועדו לשחזר את הרכב המידע ששימש לאימון מודלי הזיקוק של דיפסיק אר אחת. המידע מחולק לשלושה חלקים ברורים שנשמרים בקבצים נפרדים. חלק אחד כולל שלוש מאות אלף דוגמאות של שרשראות חשיבה שהופקו באמצעות המודל דיפסיק אר אחת עצמו, בחסות תשתית הרצה של דריה.

החלק השני מביא שלוש מאות אלף דוגמאות חשיבה נוספות שהופקו דרך ג'מיני שתיים נקודה אפס פלאש ת'ינקינג בחסות שוטס. מאתיים אלף הדוגמאות הנותרות הן שיחות רגילות ללא חשיבה מתוך הפרויקט דולפין של אריק הרטפורד וקוגניטיב קומפיוטיישנס. הכרטיס לא מפרט את אופן הסינון, הנושאים המדויקים, או תהליכי הניקוי שבוצעו על הטקסטים הללו לפני האריזה.

מתאים ל

  • זיקוק יכולות חשיבה

    אימון מודלי שפה פתוחים לייצור שרשרת חשיבה מפורטת לפי דוגמאות מוכנות.

  • אימון שיחה משולב

    בניית מודל שמסוגל לעבור בין שיחה רגילה לפתרון בעיות שדורשות פירוק שלבי.

  • השוואת סגנונות היסק

    ניתוח ההבדלים בין פלטי החשיבה של דיפסיק לאלה של ג'מיני פלאש באותן משימות.

איפה זה נופל

הכרטיס לא מוסר מידע על שפות המאגר, כך שאין שום הבטחה לנוכחות של עברית או ייצוג מחוץ לאנגלית. בנוסף, חסר פירוט על מתודולוגיית הניקוי, בדיקות רעילות, או מניעת הזיות שנוצרו על ידי המודלים המקוריים. שימוש במידע שנוצר ישירות ממודלים אחרים עלול לגרור את כל הטעויות וההטיות הפנימיות שלהם ישירות אל המשקלים שלכם, ולכן חובה לדגום את איכות שרשראות החשיבה באופן עצמאי.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לפיתוח מוצר מסחרי?

הרישיון המדווח של המאגר הוא אפאצ'י שתיים נקודה אפס, שאינו אוסר פעילות מסחרית ומחייב רק מתן ייחוס מתאים. עם זאת, שש מאות אלף דוגמאות נוצרו באמצעות מודלים חיצוניים, ולכן מפתחים צריכים לבדוק אם יש תנאי שימוש נוספים שחלים על תוצרי ההסקה הללו.

האם המאגר כולל דוגמאות בשפה העברית?

הכרטיס הרשמי אינו מזכיר עברית או פירוט שפות כלל, והוא מתאר מקורות שמתבססים על דולפין ועל מודלים כלליים באנגלית. אם אתם מחפשים אימון ייעודי לעברית, אל תבנו על המאגר הזה בלי לבדוק תחילה את הדוגמאות בפועל.

כיצד נאסף המידע בתוך הקבצים?

שלוש מאות אלף דוגמאות הופקו מהמודל דיפסיק אר אחת, שלוש מאות אלף הופקו מג'מיני שתיים נקודה אפס פלאש ת'ינקינג, ומאתיים אלף נלקחו מפרויקט דולפין צ'אט. ההרצה נעשתה בסיוע נותני חסות למחשוב ולהסקה.

איך טוענים

אתם מושכים את הקבצים ישירות מהמאגר של הוגינג פייס ללא צורך בהרשאה מוקדמת או באישור גישה. המאגר מורכב מחמישה קבצים, כאשר הנתונים עצמם מחולקים לקובצי ג'ייסון אל. יש קובץ ייעודי לדוגמאות ללא חשיבה, קובץ לדוגמאות החשיבה מדיפסיק, וקובץ לדוגמאות מג'מיני פלאש. הכרטיס לא מציין את הנפח המדויק בדיסק בג'יגה בייטים או את שמות השדות המדויקים בתוך הרשומות, לכן תצטרכו להציץ במבנה השורות הראשונות בכל קובץ לפני שאתם מתחילים להריץ סקריפט אימון מלא על כל שמונה מאות אלף השורות.

from datasets import load_dataset

ds = load_dataset("QuixiAI/dolphin-r1")

הרישיון

המאגר פורסם תחת רישיון אפאצ'י שתיים נקודה אפס, שמתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים ללא דרישה לשתף את התוצרים באותו רישיון. החובה העיקרית היא מתן קרדיט ושמירה על הודעות זכויות היוצרים המקוריות. מבחינת אימון מודלים, הרישיון של המאגר עצמו אינו מגביל מכירה או שילוב במוצרים, אך החומרים נוצרו בחלקם באמצעות מודלים מסחריים חיצוניים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗