GPT
F

FinePersonas-v0.1

קוד פתוח

argillallama32024-09-09

  • synthetic
  • distilabel

מאגר ענק של 21,071,228 פרופילים סינתטיים מפורטים. הוא מאפשר לייצר פרומפטים וטקסטים מגוונים שמחקים מומחים ואנשים שונים בלי להמציא דמויות מאפס.

  • 979הורדות בחודש
  • 409לייקים

מה זה

כל רשומה היא למעשה תיאור מילולי קצר של דמות בדיונית, שמגדיר את תחום המומחיות שלה, מטרות הלמידה, או המקצוע שלה. לצד התיאור מופיע מזהה ייחודי ותגיות סיווג שמסכמות את תחומי העניין, כמו חינוך, בינה מלאכותית, או מתמטיקה.

הבסיס לכל הדמויות האלה הוא עמודי אינטרנט מתוך הדאטהסט FineWeb-Edu. צוות הפיתוח סינן משם רק מסמכים שקיבלו ציון חינוכי של 4 ומעלה, ועל גבי הטקסטים האלה הם הריצו את המודל Meta-Llama-3.1-70B-Instruct בעזרת כלי distilabel כדי לחלץ את הפרופילים, לפי שיטת PersonaHub.

המאגר מציע שתי תצורות עיקריות. תצורת ברירת המחדל כוללת את הטקסטים והתגיות בלבד. התצורה השנייה מוסיפה וקטורי ייצוג שחושבו מראש עבור כל דמות, ומאפשרת חיפוש סמנטי ישיר לפי שכנות וקטורית.

מתאים ל

  • יצירת פרומפטים מגוונים

    הדמיית בקשות של משתמשים בעלי מקצועות שונים עבור אימון מודלי הוראות.

  • כתיבת תוכן בסגנון מוגדר

    יצירת פוסטים ומאמרים מנקודת מבט ייחודית של חוקר, מורה או מהנדס.

  • בניית שאלות ומבחנים

    ניסוח בעיות מורכבות במתמטיקה או מדעים בהתאם לרקע מקצועי ספציפי.

  • הנחיית מודלי תמונה

    שימוש בתיאורי הדמויות המפורטים כקלט למודלים מבוססי דיפוזיה ליצירת פורטרטים.

איפה זה נופל

הנתונים מוטים מאוד לעולמות האקדמיה, ההוראה והמדע, כיוון שהם נגזרו אך ורק מתוכן שקיבל ציון חינוכי גבוה. לא תמצאו כאן ייצוג אותנטי של סלנג יומיומי, שיחות רחוב, או שפות אחרות, המאגר כולו באנגלית בלבד. בנוסף, מדובר בטקסט סינתטי לחלוטין שיוצר על ידי מודל שפה, כך שיש לוודא שהוא לא מייצר תבניות לשוניות שחוזרות על עצמן לפני שמאמנים עליו מודל ייעודי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא Llama 3 והוא מתיר שימוש מסחרי. עם זאת, השימוש חייב לעמוד בכללי השימוש המקובל של חברת מטא, ויש מגבלה לחברות ענק עם מאות מיליוני משתמשים.

כמה שוקל הדאטהסט והאם חובה להוריד את כולו?

תצורת הטקסט הבסיסית שוקלת כ־3 גיגהבייט וקלה לעבודה. תצורת הווקטורים מגיעה לכ־140 גיגהבייט. אם אתם רק בודקים את ההתאמה לצורך שלכם, אפשר להוריד את גרסת המדגם שמכילה 100,000 רשומות בלבד.

האם יש בדאטהסט פרופילים בעברית?

לא. כל הרשומות במאגר נוצרו באנגלית בלבד, מתוך עמודי רשת באנגלית. אם אתם צריכים דמויות בעברית תצטרכו לתרגם את הטקסט או להריץ תהליך יצירה מקביל משלכם.

איך המאגר הזה נוצר בפועל?

היוצרים סיננו דפי רשת מתוך FineWeb-Edu לפי ציון איכות חינוכית של 4 ומעלה. לאחר מכן הם הזינו את הטקסטים למודל Meta-Llama-3.1-70B-Instruct דרך ספריית distilabel כדי שיחלץ ויגדיר מתוכם דמויות מקצועיות.

איך טוענים

טוענים את המאגר ישירות עם datasets של Hugging Face בלי צורך באישור גישה מראש. תצורת הטקסט הרגילה שוקלת כ־3 גיגהבייט וכוללת את השדות id, persona ו־labels. אם תרצו את תצורת הווקטורים המחושבים, מדובר בהורדה כבדה מאוד של כ־140 גיגהבייט שכוללת גם את המודל שייצר אותם. כדי להתנסות בלי להוריד עשרות מיליוני שורות, יש ליוצרים גרסת מדגם מוקטנת שמכילה 100,000 רשומות בלבד.

from datasets import load_dataset

ds = load_dataset("argilla/FinePersonas-v0.1")

הרישיון

המאגר מופץ תחת רישיון Llama 3. הרישיון מאפשר שימוש מסחרי ומחקר, אך מחייב עמידה במגבלות השימוש המקובלות של מטא, כולל תנאי שירות מסוימים אם כמות המשתמשים החודשית הפעילה של המוצר חוצה מאות מיליונים. מודלים שמייצרים טקסט על בסיס הנתונים האלה כפופים גם הם למגבלות הרישיון המקורי של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗