GPT
P

PersonaHub

קוד פתוח

proj-personacc-by-nc-sa-4.02024-06-28

  • synthetic
  • text
  • math
  • reasoning
  • instruction

המאגר מרכז מאות מיליוני פרסונות שחולצו מטקסטים ברשת כדי לסנטז מהן דאטה מגוון לאימון מודלים. זה פתרון למי שרוצה לייצר פרומפטים מזוויות שונות בלי להסתמך רק על ניסוחים גנריים.

  • 11,404הורדות בחודש
  • 798לייקים

מה זה

המאגר כולל אוסף עצום של פרופילי דמויות ורשומות סינתטיות שנוצרו בעזרתן. החלק המרכזי שנוסף מכיל 370 מיליון פרסונות מובחרות, לצד תצוגה מקדימה קודמת של 200 אלף דמויות. כל פרסונה מייצגת נקודת מבט או מומחיות שאמורה לדמות משתמש קצה אמיתי.

חוץ מהפרסונות עצמן, החוקרים צירפו דוגמאות לתוצרים שנוצרו איתן: 50 אלף בעיות מתמטיקה, 50 אלף שאלות הגיון, 50 אלף הוראות, 10,000 טקסטים עתירי ידע, 10,000 דמויות למשחקים ו־5,000 הגדרות של כלים ופונקציות. המקור הראשוני לפרסונות הוא טקסטים מהרשת שסוננו ועובדו אוטומטית כדי לשמש תבניות להנחיות עבור מודלי שפה.

מתאים ל

  • סינטוז פרומפטים מגוונים

    יצירת מאגרי הוראות לאימון מודלי שיחה על ידי הדמיית משתמשים עם תחומי עניין ורקעים שונים לחלוטין.

  • בניית בעיות חשיבה

    הפקת עשרות אלפי תרגילי מתמטיקה ומבחני לוגיקה ברמות קושי שונות לצורכי אימון והערכה של מודלים.

  • יצירת דמויות למשחקים

    שימוש ברשומות הסינתטיות כדי לאכלס משחקים בעשרות אלפי דמויות ללא שחקן בעלות אופי מוגדר.

איפה זה נופל

החומר קיים באנגלית ובסינית בלבד, בלי שום כיסוי לעברית או להקשרים מקומיים. המפרסמים מציינים במפורש שהדאטה הסינתטי נוצר באמצעות GPT-4, Llama-3 ו־Qwen, ולכן הוא כולל הטיות מובנות של המודלים האלה, לצד סיכון לתוכן שגוי או לא בטוח. לא מדובר באנשים אמיתיים אלא בהפשטות אוטומטיות, ולפני שמריצים אימון למוצר צריך לסנן רעלים ולוודא שהפרופילים לא מייצרים שגיאות עובדתיות בתחומים רגישים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. המאגר מופץ תחת רישיון cc-by-nc-sa-4.0 המגביל את השימוש למטרות לא מסחריות ומחקריות בלבד. בנוסף, חל איסור מסחרי שנובע מרישיונות המודלים ששימשו לסנטוז הנתונים.

האם יש במאגר תמיכה בעברית?

לא, המאגר מסומן רשמית עבור אנגלית וסינית בלבד. כל הפרסונות והדוגמאות הסינתטיות נכתבו בשפות אלו, ואין בו ייצוג ייעודי לדוברי עברית.

מאיפה הגיעו הנתונים שבפנים?

הפרסונות חולצו באופן אוטומטי מטקסטים ציבוריים ברשת. הדוגמאות הסינתטיות, כמו שאלות המתמטיקה והכלים, נוצרו על ידי הפעלת מודלי שפה בהם GPT-4, Llama-3 ו־Qwen בהנחיית אותן פרסונות.

איך המאגר מאורגן מבחינת קבצים?

הוא כולל 29 קבצים, כאשר עיקר הנפח נמצא בחלקי jsonl נפרדים תחת תיקיית ElitePersonas. החלוקה הזו מאפשרת להוריד ולעבד חלקים מסוימים בלי לטעון את כל 370 מיליון הרשומות בבת אחת.

איך טוענים

הנתונים מחולקים ל־29 קבצים, בעיקר בפורמט jsonl בתיקיית ElitePersonas שמחולקת לחלקים ממוספרים. אפשר להוריד את הקבצים ישירות או לטעון דרך ספריית datasets בלי צורך באישור גישה מיוחד, אבל מדובר בהיקף של מאות מיליוני שורות כך שצריך שטח אחסון מתאים וכוח עיבוד סביר לפני שפורסים הכל לזיכרון. המפתחים מספקים גם סקריפטים בגיטהאב שמחברים את המאגר ל־vLLM או ל־OpenAI לצורך יצירת דאטה בפועל.

from datasets import load_dataset

ds = load_dataset("proj-persona/PersonaHub")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, מה שאומר שאסור להשתמש במאגר למטרות מסחריות כלל. מותר לחקור, לשנות ולשתף, בתנאי שנותנים קרדיט ומפיצים יצירות נגזרות תחת אותו רישיון בדיוק. אם תאמנו מודל ישירות על הנתונים האלה, לא תוכלו למכור אליו גישה או לשלב אותו במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗