GPT
G

GenQA

קוד פתוח

genqaרישיון לא דווח2024-06-13

מעל עשרה מיליון דוגמאות אימון סינתטיות שנכתבו על ידי מודל שפה, ללא התבססות על שאלות אנושיות. המאגר מתאים לחוקרים שמחפשים כמות עצומה של שיחות להוראות ולכוונון מודלים.

  • 1,120הורדות בחודש
  • 54לייקים

מה זה

המאגר מכיל מעל עשרה מיליון רשומות שמדמות שיחות בין משתמש לעוזר וירטואלי, כולל אינטראקציות של פנייה בודדת ורב שיח. כל המידע יוצר בצורה אוטונומית באמצעות מודל השפה Gemini על בסיס קומץ פרומפטים מתוכננים, ללא התערבות של מתייגים אנושיים או שימוש בשאלות של בני אדם כמקור.

לאחר שלב היצירה ביישומי פייתון, הנתונים עברו סינון להסרת כפילויות וניקוי. המבנה מחולק לפי תתי תחומים ונושאים כמו academic, dialog וקוד, כאשר שדות הנתונים כוללים את השיחה עצמה, הפרומפט ששימש ליצירתה, תבנית הפרומפט וסיווג לפי קטגוריות.

מתאים ל

  • אימון מודלים בקנה מידה רחב

    אימון מקדים של מודלי שפה על שיחות והוראות בהיקף של מיליוני דוגמאות באנגלית.

  • מחקר על דאטה סינתטי

    בדיקת השפעת נתונים שנוצרו במלואם על ידי מכונה מול נתונים שנאספו מבני אדם.

  • כיסוי חוסרים במאגרים קיימים

    שילוב דוגמאות מתוך פיצולים ייעודיים כמו קוד או אקדמיה כדי להרחיב מאגרי אימון.

איפה זה נופל

כל הטקסט במאגר נוצר על ידי מכונה ולא עבר בדיקה אנושית לאימות עובדתי. היוצרים מצהירים במפורש שייתכנו אי דיוקים עובדתיים רבים, ולכן אסור להשתמש במידע הזה ליישומים שדורשים דיוק, קבלת החלטות קריטית או הסתמכות על אמת מדעית.

בנוסף, כל השיחות נוצרו באנגלית בלבד. המאגר אינו מכיל עברית, ואין בו ייצוג לשאלות אמיתיות שבני אדם שואלים בפועל, אלא רק למה שמודל שפה מניח שבני אדם שואלים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא. החוקרים ציינו בכרטיס הדאטהסט רישיון CC BY-NC 4.0, שאוסר כל שימוש מסחרי. המאגר מיועד אך ורק למחקר פתוח ולקהילה האקדמית.

האם הדאטהסט מכיל נתונים בעברית?

לא, כל הנתונים נוצרו בשפה האנגלית בלבד. אם המטרה היא כוונון מודל לשיחה בעברית, המאגר הזה לא יספק מענה ללא תרגום.

איך נוצרו עשרה מיליון הדוגמאות?

החוקרים השתמשו במודל השפה Gemini ובקומץ פרומפטים כדי לייצר את כל השאלות והתשובות באופן אוטונומי. לאחר מכן הנתונים נוקו ועברו סינון כפילויות באמצעות סקריפטים בפייתון.

האם הנתונים אמינים מבחינה עובדתית?

לא בהכרח, והיוצרים מציינים זאת בגלוי. מכיוון שהתוכן סינתטי לחלוטין ומעולם לא נבדק על ידי בני אדם, הוא מכיל שגיאות והזיות מובנות של מודל המקור.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות ציון המזהה genqa/GenQA, וניתן להגדיר פיצול ספציפי כמו academic או dialog. המאגר פתוח לציבור ואינו דורש אישור גישה מוקדם, אך הוא מחולק לעשרות קבצי Parquet שמכילים נפח עצום של מעל עשרה מיליון שורות, ולכן מומלץ להוריד רק את הפיצול הרלוונטי.

השדה החשוב ביותר הוא text, שמכיל רשימת אובייקטי JSON המותאמים ישירות לתבניות השיחה של ספריית transformers. בנוסף קיימים השדות prompt, template והשדה category שממיין נתוני קוד לתכנות, ספריות וסימון מרקדאון.

from datasets import load_dataset

ds = load_dataset("genqa/GenQA")

הרישיון

למרות שבמטה דאטה של העמוד נכתב שהרישיון לא דווח, בכרטיס המאגר עצמו החוקרים מציינים רישיון מסחרי מגביל מסוג CC BY-NC 4.0. משמעות הדבר היא שהשימוש מותר למטרות מחקר ולימוד בלבד, ואסור לחלוטין להשתמש בו לאימון מודלים מסחריים או למוצרים מניבים. במקרה של שימוש מחקרי, חובה לתת קרדיט ליוצרים מאוניברסיטת מרילנד.

הרישיון המלא ב־Hugging Face ↗