GPT
R

retarded_bar

קוד פתוח

hugfaceguy0001openrail2023-04-17

מאגר קטן של בדיחות היגיון עקום ומשחקי מילים מפורום סיני מוכר, שמיועד לבחון אם מודל מבין הומור אבסורדי. הוא שימושי למי שרוצה לבדוק עמידות של מודלי שפה בשאלות מתקילות במנדרינית.

  • 112הורדות בחודש
  • 60לייקים

מה זה

המאגר מכיל בדיוק 100 בדיחות שנאספו ידנית מהפורום הפופולרי Ruozhiba באתר Baidu Tieba. הבדיחות שם נשענות על משחקי מילים, חלוקת משפטים מוזרה והיגיון עקום, מסוג הדברים שמודלי שפה נוטים ליפול בהם בקלות. החומר כולו במנדרינית בלבד, ללא תרגום.

הקובץ מחולק לשניים לפי סוג המשפט. החלק הראשון כולל 45 בדיחות כמשפטי חיווי עם ניתוח הפואנטה, פירוט משחקי המילים שזוהו וציון האם הניתוח נכתב בידי אדם או מודל. החלק השני מכיל 55 שאלות מתקילות יחד עם תשובות שמנסות להגיב להומור בנימוס ובאופן עובדתי, וגם כאן מסומן מי כתב את התשובה.

מתאים ל

  • מבחן עמידות למודלים

    בדיקה אם מודל שפה במנדרינית מזהה שאלת היגיון עקום או עונה לה ברצינות מוחלטת.

  • הערכת פענוח הומור

    מדידת היכולת של מודל לזהות משחקי מילים ומשמעויות כפולות בשפה הסינית.

  • בנצ'מרק תגובה מנומסת

    בחינת תגובות של סוכני שיחה לשאלות מטופשות בלי לאבד דיוק עובדתי או נימוס.

איפה זה נופל

זהו מאגר זעיר מדי לאימון רציני. מאה דוגמאות מתאימות להערכה נקודתית בלבד. הטקסטים תלויים לחלוטין בהקשר תרבותי ולשוני של מנדרינית, כך שאין להם שום רלוונטיות לעברית או לאנגלית. היוצר עצמו מודה שהניתוחים והתשובות נכתבו בחלקם על ידי מודל וחלקם בידיו, ורמת הניסוח לא תמיד מיטבית. בנוסף, הטקסטים נאספו מפורום ציבורי ברשת, כך שיש שאלות של זכויות יוצרים על התוכן המקורי שפורסם שם.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. כל הנתונים מבוססים על בדיחות מפורום סיני ונכתבו במנדרינית בלבד. אין במאגר תרגום או התאמה לשפות אחרות, וההומור נשען על מבנה השפה הסינית.

כמה רשומות יש במאגר ומה הגודל שלו?

יש בו בדיוק 100 רשומות שמחולקות לשני קבצים, 45 בקובץ אחד ו־55 בשני. מדובר בקובצי טקסט זעירים בגודל של קילובייטים בודדים, כך שהטעינה מיידית.

האם אפשר להשתמש בו לאימון מודל מסחרי?

הרישיון המוצהר הוא OpenRAIL, אך הטקסטים נאספו ישירות מקהילה באתר Baidu Tieba ללא הסדרת זכויות יוצרים מול הכותבים. היוצר מציין במפורש שיש לשים לב לבעיות זכויות יוצרים, ולכן לא מומלץ להסתמך עליו במוצר מסחרי.

איך נוצרו התיוגים וההסברים לבדיחות?

היוצר אסף את הבדיחות ידנית מהרשת וכתב חלק מההסברים בעצמו. חלק אחר מהניתוחים והתשובות נוצר באמצעות מודל שפה, ובכל רשומה מסומן במפורש האם המקור הוא אנושי או מכונה.

איך טוענים

אין כאן צורך באישור גישה מיוחד או הורדה כבדה. המאגר כולל שני קובצי JSONL קטנים: retarded_bar.jsonl עבור משפטי החיווי ו־retarded_bar_qa.jsonl עבור השאלות והתשובות. אפשר לטעון אותם בשורה אחת עם ספריית jsonlines או datasets של Hugging Face. השדות המרכזיים שצריך לשים לב אליהם הם טקסט הבדיחה, שדה הניתוח או התשובה, ושדה שמציין אם הפירוש נוצר על ידי בן אדם או על ידי מודל שפה.

from datasets import load_dataset

ds = load_dataset("hugfaceguy0001/retarded_bar")

הרישיון

המאגר מוגדר תחת רישיון OpenRAIL. רישיונות מסוג זה מאפשרים בדרך כלל שימוש חופשי ואימון מודלים, אך מטילים מגבלות שימוש ספציפיות על יישומים מסוכנים או פוגעניים. מאחר שהטקסטים נאספו מפורום באינטרנט ללא הסדרה מול הכותבים המקוריים, כדאי להיזהר משימוש מסחרי ישיר בטקסט עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא ב־Hugging Face ↗