GPT
M

Machine_Mindset_MBTI_dataset

קוד פתוח

pandallaapache-2.02024-01-04

המאגר מרכז דוגמאות התנהגותיות לאימון מודלים לפי טיפוסי אישיות של MBTI. הוא מיועד למי שרוצה לכייל אופי מסוים בצ'אטבוט או לחקור פרסונות שונות.

  • 325הורדות בחודש
  • 71לייקים

מה זה

המאגר כולל 50 קבצים בפורמט Alpaca עם השדות הרגילים, instruction, input ו־output. המידע מחולק לפי ארבעת הממדים המוכרים של MBTI, אנרגיה, מידע, החלטה וביצוע, כשכל ממד כולל את שני הקטבים הנגדיים שלו. בנוסף יש קבצים שמוקדשים למודעות עצמית של טיפוסים ספציפיים כמו ENFJ או ESTJ.

התוכן זמין בשתי שפות בלבד, אנגלית וסינית, לפי הקידומות en ו־zh בשמות הקבצים. כרטיס המאגר לא מפרט מאיזה מקורות הגיעו הטקסטים בפועל או אילו סינונים הם עברו, אלא רק מציג עותק זהה שנמצא בפרויקט הגיטהאב Machine-Mindset של קבוצת PKU-YuanGroup.

מתאים ל

  • אימון SFT לפרסונה ספציפית

    מרכיבים ארבעה קבצי תכונות כדי להקנות למודל אופי מוגדר מראש לפי מודל הטיפוסים.

  • אופטימיזציית העדפה ב־DPO

    משתמשים בקטבים מנוגדים כמו רגש מול חשיבה כדי לדייק את סגנון קבלת ההחלטות.

  • מחקר על פרסונות מבוססות שפה

    בודקים כיצד שפות שונות, אנגלית מול סינית, משפיעות על ביטוי תכונות אופי במודל.

איפה זה נופל

הבעיה המרכזית היא חוסר שקיפות מוחלט לגבי מקור הדאטה. הכרטיס לא מציין מי כתב את התשובות, האם הן נוצרו על ידי בני אדם או סונטזו על ידי מודל אחר, ואיך נמדדה ההתאמה האמיתית לטיפוס ה־MBTI. מעבר לזה, המאגר מוגבל רק לאנגלית ולסינית, כך שאין כאן שום ייצוג לעברית. מי שבונה מוצר צריך לבדוק היטב אם התיוג לא מייצר סטריאוטיפים מוגזמים או תשובות מאולצות שלא מתאימות לשיחה טבעית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מפורסם תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי מלא ושינוי של הנתונים, כל עוד שומרים על תנאי הייחוס והודעות הזכויות המקוריות.

האם המאגר כולל נתונים בעברית?

לא. הקבצים מחולקים באופן מפורש לשתי שפות בלבד, אנגלית וסינית, לפי הקידומות en ו־zh. אם אתם צריכים התנהגות כזו בעברית, תצטרכו לתרגם את הדוגמאות או לאסוף דאטה מקביל.

מאיפה הגיעו הנתונים ואיך הם נאספו?

היוצרים לא פירטו בכרטיס המאגר את מקור הדאטה, את תהליך הסינון או את אופן יצירת השדות. הם רק מפנים לפרויקט Machine-Mindset בגיטהאב, כך שלא ידוע אם מדובר בטקסט אנושי אותנטי או בדאטה שסונטז על ידי מודלים.

איך טוענים

טוענים ישירות את קובצי ה־JSON הרצויים מהמאגר הפתוח, בלי צורך בבקשת גישה מיוחדת. אם המטרה היא אימון SFT לטיפוס ספציפי, בוחרים את ארבעת הקבצים שמרכיבים אותו לפי הממדים, למשל קובצי אינטרוברטיות, חישה, רגש ושיפוט. מי שבונה אימון DPO כדי לחזק נטייה מסוימת מול הנגדית לה צריך לקחת זוג קבצים מאותו ממד ולסדר אותם בפורמט ההעדפה לפי ההנחיות בגיטהאב.

from datasets import load_dataset

ds = load_dataset("pandalla/Machine_Mindset_MBTI_dataset")

הרישיון

הרישיון המדווח הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה, ומודל שאומן עליו לא מחייב פתיחה של הקוד. נדרש רק לתת קרדיט ולצרף עותק של הרישיון וכתב הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗