GPT
P

P-MMEval

קוד פתוח

Qwenapache-2.02024-11-13

יש כאן גם סקירה על Qwen עצמו.

בנצ'מרק רב לשוני מקבילי שנועד להעריך מודלי שפה על פני עשר שפות שונות. המאגר מאפשר לבדוק יכולות הבנה והסקה בהשוואה ישירה בין שפות מאותן דגימות בדיוק.

  • 6,469הורדות בחודש
  • 18לייקים

מה זה

המאגר מרחיב מבחני ביצועים קיימים כמו פלורס ומספק דגימות מקבילות בעשר שפות משמונה משפחות שפה שונות. הרשומות מחולקות לקובצי טקסט במבנה שורות ג'ייסון לפי שפות ומשימות, וכוללות משימות בסיסיות לצד מבחני יכולת ייעודיים. המטרה היא לייצר עקביות בבדיקה, כך שכל מודל נבחן על אותו תוכן מתורגם או מקביל במקום על מבחנים שונים לכל שפה.

השפות הנתמכות כוללות ערבית, ספרדית, צרפתית, יפנית, קוריאנית, פורטוגזית, תאילנדית, וייטנאמית, אנגלית וסינית. מבנה הקבצים במאגר מציג חלוקה ממוקדת לכל שפה בנפרד תחת משימות ההערכה, דבר שמקל על בדיקת יכולות ספציפיות כמו תרגום או מענה לשאלות בכל שפה בנפרד ובאופן השוואתי.

מתאים ל

  • השוואת ביצועים רב לשונית

    בדיקת איכות התשובות של מודל שפה על פני עשר שפות שונות מאותן דגימות מקבילות.

  • מדידת העברה בין לשונית

    בחינת היכולת של מודל להשליך ידע ופתרון משימות משפת אימון מרכזית לשפות יעד אחרות.

  • בנצ'מרק עם אופן קומפאס

    הרצת סוויטת הערכה מובנית על מודלים בקוד פתוח או סגור בעזרת כלי הערכה סטנדרטיים.

איפה זה נופל

עברית לא נכללת במאגר הזה בכלל, ולכן למפתחים ישראלים שמתמקדים בשוק המקומי אין כאן מענה ישיר. המאגר מיועד לבדיקה ולהערכה ולא לאימון מודלים, כך שלא מדובר בחומר גלם לפיין טיונינג. בנוסף, מודלים קטנים מאוד עשויים להתקשות בחילוץ התשובות עקב קושי במעקב אחר הוראות, מה שעלול להטות את תוצאות המדידה בלי קשר לרמת השפה עצמה.

שאלות
נפוצות

האם המאגר כולל תמיכה בשפה העברית?

לא, המאגר כולל עשר שפות בלבד ובהן ערבית, אנגלית, סינית, ספרדית וצרפתית, אך עברית אינה מופיעה בו. אם המטרה היא להעריך ביצועים בעברית, תצטרכו להשתמש בבנצ'מרקים אחרים שכוללים נתונים מקומיים. המאגר כן יכול להתאים אם אתם בודקים ביצועים באזור עם שפות כמו ערבית.

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, הרישיון המדווח הוא אפאצ'י שתיים אפס, רישיון קוד פתוח שמתיר שימוש מסחרי. מותר להריץ את הבדיקות על מודלים שמיועדים למוצרים מסחריים ללא תשלום תמלוגים. חובת הרישיון העיקרית היא מתן קרדיט מתאים ושמירה על תנאי הרישיון המקוריים בקבצים.

האם המאגר מתאים לאימון מודלים או רק להערכה?

המאגר תוכנן ונבנה במפורש כבנצ'מרק להערכת יכולות של מודלי שפה קיימים. הנתונים מאורגנים כמבחנים مقבילים ואינם כוללים כמויות טקסט שמספיקות לאימון מקדים. מומלץ להשתמש בו אך ורק כדי לקבל ציוני השוואה בין גרסאות של מודלים.

מה היתרון שלו על פני מבחני הערכה רב לשוניים רגילים?

המאגר מציע דגימות מקבילות לחלוטין בין עשר השפות הנתמכות עבור אותן המשימות. בניגוד למבחנים שבהם כל שפה מקבלת שאלות שונות ברמות קושי שונות, כאן ההשוואה אחידה. הדבר מאפשר למדוד באופן מדויק פערים בהבנה ובהסקה בין שפות שונות על אותו תוכן בדיוק.

איך טוענים

המאגר כולל 448 קבצים בפורמט ג'ייסון אל המחולקים לפי שפות ומשימות. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים מהמאגר. צוות הפיתוח ממליץ להריץ את ההערכה באמצעות כלי הבדיקה של אופן קומפאס בשילוב ספריית וי אל אל אם להאצה. הגישה לנתונים יכולה להתבצע דרך סקריפט הבדיקה המובנה או בטעינה ישירה של קובצי הטקסט לצורך בחינה עצמאית.

from datasets import load_dataset

ds = load_dataset("Qwen/P-MMEval")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון, ומותר לבצע הערכות על מודלים מסחריים ופנימיים בלי לחשוף את תוצרי הפיתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗