GPT
C

creativity

קוד פתוח

froggericרישיון לא דווח2024-02-26

  • benchmark
  • leaderboard

המאגר כולל תוצאות מבחן השוואתי עבור מודלי שפה בכתיבה יוצרת ללא צנזורה. הוא פונה למי שמחפש לראות ציונים ידניים של מודלים פתוחים במשימות טקסט מורכבות ורגישות.

  • 95הורדות בחודש
  • 88לייקים

מה זה

בניגוד לשם שלו, המאגר אינו מכיל דאטהסט סטנדרטי לאימון אלא קובץ תוצאות בדיקה בשם benchmark-results.csv לצד קובץ תיעוד. המחבר בחן מודלים שונים מול 24 שאלות, חלקן עצמאיות וחלקן שיחות מרובות שלבים. השאלות עצמן אינן מפורסמות במאגר כדי למנוע דליפה למאגרי אימון עתידיים, אך המחבר ציין את תחומי הבדיקה הכלליים.

השאלות חולקו שווה בשווה בשני צירים נפרדים. בציר הראשון מחציתן הן שאלות רגילות ובטוחות, ומחציתן שאלות הכוללות נושאים למבוגרים ונושאים בלתי חוקיים שנועדו לבחון מנגנוני סירוב וצנזורה. בציר השני מחצית מהשאלות מתמקדות בכתיבת סיפורים ועלילה, בעוד המחצית השנייה בודקת יכולות עוזר אישי, תכנון והבנת טקסטים מורכבים.

מתאים ל

  • בחירת מודל קוד פתוח

    השוואת ביצועים סובייקטיביים בין גרסאות ממוזגות ומכווננות של מודלים פתוחים לצורכי כתיבה.

  • בדיקת עמידות לצנזורה

    למידה על שיטות שונות לעקיפת סירובים במודלי שפה באמצעות הנחיות ראשוניות ותחיליות שיחה.

  • מדד לכימות כתיבה יוצרת

    בחינת מתודולוגיית הניקוד הידנית לצורך בניית מבחני הערכה דומים בארגון.

איפה זה נופל

זהו אינו סט נתונים שמתאים לאימון מודלים. חסרות בו השאלות עצמן וחסרות התשובות המלאות שהופקו, כך שיש בו רק ציונים מספריים והערות. הבדיקה בוצעה כולה באנגלית, ללא כל תמיכה או התייחסות לשפות אחרות כולל עברית. בנוסף, מדובר בהערכה סובייקטיבית לחלוטין של אדם יחיד, שבחר גם לעקוף ידנית סירובי מודלים בעזרת הזרקת תחיליות לתשובה, כך שהתוצאות אינן משקפות פעולה אוטומטית נקייה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ לעשות זאת. למאגר לא הוגדר רישיון שימוש, ולכן אין היתר משפטי להשתמש בתוכן שלו למוצרים מסחריים. מעבר לכך, אין בו נתונים שאפשר לאמן עליהם מוצר אלא רק טבלת ציונים.

האם המאגר מכיל נתונים בעברית?

לא. כל המבחנים וההערכות בוצעו בשפה האנגלית בלבד. המחבר אף מציין מפורשות ששימוש במטריצות חשיבות מסוימות באנגלית עלול לפגוע ביכולות רב לשוניות של המודלים.

האם המאגר מכיל את הטקסטים ששימשו לאימון?

לא, אין כאן טקסטים לאימון. מדובר במבחן ביצועים שמכיל 24 שאלות שנבדקו ידנית, כאשר אפילו נוסח השאלות המדויק אינו מופיע בקובץ כדי למנוע את זיהומן ברשת.

כמה שוקל המאגר ומה הוא מכיל בפועל?

המאגר זעיר וכולל שלושה קבצים בלבד, ביניהם קובץ התיעוד וקובץ הניקוד benchmark-results.csv. סך כל הרשומות קטן מאלף, והוא שוקל פחות ממגה בייט בודד.

איך טוענים

טעינת הנתונים מתבצעת כקובץ טבלאי פשוט, ישירות מהקובץ benchmark-results.csv הנמצא במאגר, או באמצעות ספריית הדאטהסטים של Hugging Face. אין צורך באישור גישה או בטופס מקדים. המאגר קטן מאוד ושוקל פחות ממגה בודד, כשהשדות המרכזיים שבו מציגים את שמות המודלים שנבדקו, הגרסאות שלהם, וסך הניקוד שהוענק להם עבור התשובות.

from datasets import load_dataset

ds = load_dataset("froggeric/creativity")

הרישיון

למאגר לא דווח רישיון כלל. מבחינה משפטית, היעדר רישיון משמעו שכל הזכויות שמורות למחבר, ואין אישור מפורש לשימוש מסחרי, הפצה מחדש או התבססות על הנתונים לבניית מוצרים. אפשר לקרוא את הציונים לצורך השוואה ומחקר פנימי, אך לא מומלץ לשלב את התוכן במערכת מסחרית.

הרישיון המלא ב־Hugging Face ↗