GPT
P

PolyMath

קוד פתוח

Qwenרישיון לא דווח2025-04-25

יש כאן גם סקירה על Qwen עצמו.

מאגר מבחן רב-לשוני מקיף שמיועד להערכת יכולות חשיבה מתמטית במודלי שפה. הוא כולל תרגומים מקבילים ב־18 שפות שונות ומחולק לארבע רמות קושי מוגדרות היטב.

  • 7,307הורדות בחודש
  • 47לייקים

מה זה

המאגר כולל בעיות מתמטיות מקבילות שתורגמו ל־18 שפות שונות, בהן אנגלית, ערבית, גרמנית, רוסית, סינית, צרפתית, ספרדית ועוד. המקורות מכסים טווח רחב שנע ממתמטיקה ברמת בית ספר ועד לאולימפיאדות מתמטיות ונושאים מתקדמים באקדמיה. כדי להבטיח איכות תרגום ודיוק במונחים מקצועיים, התרגומים עברו כיול ובדיקה אנושית בידי מומחי שפה ולא הועלו ישירות מפלט מכונה.

המבנה מאורגן לפי 18 קונפיגורציות שפה, כשכל שפה מחולקת לארבע רמות קושי נפרדות: low, medium, high ו־top. בכל שפה יש 125 בעיות עבור כל רמת קושי, כך שכל שפה מחזיקה בדיוק 500 בעיות מתמטיות מקבילות. החלוקה לרמות נקבעה על פי שני ממדים מרכזיים של עומק החשיבה הנדרש ורוחב הידע המתמטי הנחוץ לפתרון.

מתאים ל

  • הערכת מודלים רב-לשונית

    בדיקת יכולת הפתרון המתמטי של מודל שפה על פני 18 שפות במקביל.

  • מדידת ביצועים לפי קושי

    בחינת נקודת השבירה של מודל במעבר מבעיות בסיסיות לרמת אולימפיאדה.

  • השוואת איכות בין שפות

    בדיקה אם המודל מסיק מסקנות מתמטיות זהות בשפות נפוצות לעומת שפות דלות משאבים.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא שעברית אינה נכללת ברשימת 18 השפות, אף שערבית קיימת. בנוסף, מדובר במאגר הערכה מצומצם יחסית של 500 שאלות בלבד לכל שפה, ולכן הוא מתאים למבחני ביצועים ולא כחומר גלם לאימון מודלים. מאחר שהתרגומים נשענים על עיבוד וכיול של בעיות קיימות, קיימת סכנה מסוימת לחשיפת השאלות בתוך נתוני האימון של מודלים גדולים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא מומלץ בכלל כרגע. המפתחים לא ציינו רישיון רשמי בעמוד המאגר, ולכן אין הרשאה משפטית מפורשת לשימוש מסחרי או לשילוב במוצרים.

האם יש במאגר שאלות בעברית?

לא. המאגר מכיל 18 שפות בלבד, ביניהן ערבית, רוסית, סינית ואנגלית, אך עברית נותרה בחוץ ולא נכללת באף רמת קושי.

כמה שאלות יש בסך הכל בכל שפה?

בכל שפה קיימות 500 שאלות בסך הכל. הן מחולקות באופן שווה של 125 שאלות לכל אחת מארבע רמות הקושי.

האם הדאטהסט מתאים לאימון מודלים?

לא, המאגר נועד לשמש כבנצ'מרק להערכה ומכיל כמות קטנה של דוגמאות לכל שפה. שימוש בו לאימון יפגע ביכולת להעריך עליו בעתיד.

איך טוענים

הנתונים שמורים בקובצי parquet מסודרים לפי שפות ורמות קושי, בסך הכל 79 קבצים במאגר כולל תמונות תיעוד. כדי לעבוד איתו פשוט טוענים את תצורת השפה הרצויה מתוך 18 האפשרויות, למשל ar או en, ובוחרים את הפיצול הרלוונטי מתוך ארבע רמות הקושי. המאגר פתוח להורדה ישירה ללא צורך בהגשת בקשת גישה או אישור מיוחד מצוות הפיתוח.

from datasets import load_dataset

ds = load_dataset("Qwen/PolyMath")

הרישיון

בדף המאגר לא דווח רישיון שימוש כלל. מבחינה משפטית, היעדר רישיון מוגדר מונע שימוש מסחרי ומעמיד בסיכון גם פיתוחים פנימיים או אימון מודלים. עד שהיוצרים לא יפרסמו תנאי רישוי ברורים בקוד או במאגר, אפשר להסתמך עליו בזהירות אך ורק למחקר עצמאי ובדיקות השוואתיות.

הרישיון המלא ב־Hugging Face ↗