GPT
G

General-Knowledge

קוד פתוח

MuskumPillerumרישיון לא דווח2023-08-15

המאגר מרכז שאלות ותשובות בידע כללי והסקה כדי לאמן מודלים על עובדות בסיסיות. הוא מתבסס בחלקו על אלפקה ומתאים למי שמחפש סט שאלות ותשובות מוכן באנגלית.

  • 463הורדות בחודש
  • 51לייקים

מה זה

המאגר מכיל זוגות של שאלות ותשובות, תחת המבנה הפשוט של שני שדות בלבד: Question ו־Answer. הרשומות מחולקות לפי נושאים, כאשר ישנם 6315 פריטים שאינם שייכים לאלפקה. מתוכם, קטגוריית העובדות תופסת 80.8%, והיא מתפצלת לתתי תחומים: טבע עם 16.5%, פיזיקה וכימיה עם 16.3%, אנשים עם 16%, ספורט עם 13.5%, גאוגרפיה והיסטוריה עם 11.2%, ותחום המחשוב, בינה מלאכותית ורובוטיקה שמקבל 7.3%.

שאר הדאטהסט מורכב מתחום ההמלצות, ההסקה והדילמות עם 17.8%, ועוד קטגוריה כללית של אחרים עם 1.4%. המקורות נשענים על השראה מדאטהסט האלפקה של סטנפורד, והוא אף כולל בתוכו תת קבוצה מתוך האלפקה המקורי. המפרסם לא פירט כיצד בדיוק נאסף החלק שאינו אלפקה או אילו שיטות סינון הופעלו על הטקסטים.

מתאים ל

  • אימון מודלי שיחה לעובדות

    לימוד מודלים מענה ישיר לשאלות ידע כללי בנושאי טבע, היסטוריה ואנשים על בסיס זוגות טקסט מוכנים באנגלית.

  • בדיקת יכולות הסקה

    הערכת ביצועי מודל על שאלות חשיבה, דילמות והמלצות שמרוכזות בקטגוריית ההסקה במאגר.

  • העשרת פרומפטים

    שילוב שאלות ותשובות קצרות במאגר דוגמאות עבור משימות text-generation או sentence-similarity.

איפה זה נופל

הנתונים קיימים באנגלית בלבד, ואין כאן עברית כלל. מעבר לכך, הכרטיס אינו מציין כיצד נאספו 6315 הרשומות שאינן מאלפקה, האם נעשתה בדיקת עובדות אנושית, או מה רמת הדיוק של התשובות. תחומי מדע ורובוטיקה מקבלים נתח קטן יחסית לשאר הנושאים. לפני שמשלבים את המאגר במודל ייעודי, צריך לבדוק ידנית מדגם של תשובות ולוודא שהמידע אינו מוטה או מיושן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

בכרטיס כתוב שהמאגר תחת רישיון MIT, שמאפשר שימוש מסחרי חופשי עם ייחוס. מצד שני, המטא דאטה הרשמי מוגדר ללא רישיון מדווח, והמאגר כולל נתונים מדאטהסט אלפקה. מומלץ לבדוק את מקור הנתונים לפני שמכניסים אותו למוצר מסחרי.

האם יש במאגר תוכן בעברית?

לא. המאגר מוגדר כדובר אנגלית בלבד, וכל השאלות והתשובות מנוסחות בשפה זו. כדי להשתמש בו עבור קהל מקומי תצטרכו לתרגם את הרשומות.

מה הגודל של המאגר?

המאגר כולל 3 קבצים בסך הכל, וביניהם קובץ הנתונים output.json. מבחינת כמות, מצוין שיש 6315 פריטים שאינם שייכים לאלפקה, ובנוסף אליהם קיימת תת קבוצה שנלקחה ישירות מאלפקה.

איך המידע נאסף ונבדק?

הכרטיס לא מפרט את אופן האיסוף או שיטות הסינון של הנתונים החדשים. מצוין רק שהמאגר נבנה בהשראת אלפקה של סטנפורד וכולל חלק ממנו, כך שאין תיעוד לגבי בדיקת נכונות העובדות.

איך טוענים

המאגר כולל שלושה קבצים, ביניהם קובץ התיעוד וקובץ בשם output.json שמכיל את הרשומות. אין צורך בבקשת גישה מיוחדת כדי למשוך את הנתונים, והטעינה מתבצעת ישירות מהפורמט של Hugging Face או באמצעות קריאת ה־JSON. כל רשומה מורכבת מהשדות Question ו־Answer, כך שעיבוד הנתונים פשוט ואינו דורש מיפוי מורכב של מאפיינים.

from datasets import load_dataset

ds = load_dataset("MuskumPillerum/General-Knowledge")

הרישיון

במטא דאטה של העמוד מצוין שלא דווח רישיון, אך בטקסט החופשי של הכרטיס המפרסם כותב שהשימוש הוא תחת רישיון MIT. הפער הזה מחייב זהירות משפטית. אם אכן מדובר ב־MIT, השימוש חופשי גם למטרות מסחריות בכפוף למתן ייחוס. עם זאת, מכיוון שהמאגר כולל חלקים מאלפקה שנוצרו במקור מתוצרי מודלים מסחריים, כדאי לבדוק היטב את תנאי המקור לפני אימון מודל מסחרי.

הרישיון המלא ב־Hugging Face ↗