GPT

מודלים ותשתית · לא צוין

הלוגו של MathEval

MathEval

מאגר מבחנים שבודק ביצועים של מודלי שפה בפתרון בעיות מתמטיות. הוא כולל כמעט 30,000 שאלות שמחולקות לעשרים מאגרי נתונים שונים, החל מחשבון בסיסי ועד לתחרויות ומתמטיקה גבוהה.

בניגוד למבחנים כלליים של בינה מלאכותית, הפרויקט מתמקד אך ורק בחשיבה כמותית. הוא מאפשר לחבר מודלים מפיתוח עצמי, מודלים פתוחים ממאגרים כמו Hugging Face, או מודלים מסחריים דרך ממשקי תכנות, ולראות טבלת הישגים מסודרת.

  • מודלים ותשתית
  • לא צוין
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
לא צוין
קטגוריה
מודלים ותשתית
שפת האתר
אנגלית
כתובת
matheval.ai
נבדק
2026-09-08

הסקירה

MathEval מריץ מודלי שפה על עשרים מאגרי בחינה שונים במתמטיקה כדי לבדוק מי מהם באמת יודע לחשב ולפתור בעיות, ומציג את התוצאות בטבלת דירוג פתוחה. האתר מציע סביבת בדיקה שכוללת כמעט 30000 שאלות, החל מחשבון בסיסי, דרך מבחני כניסה לאוניברסיטה כמו GAOKAO, ועד תחרויות ומתמטיקה גבוהה. מי שמפתח מודל יכול לבדוק אותו מול מודלים קיימים כמו GPT-4 או סדרת LLaMA2, ולראות איפה המודל שלו נשבר.

המערך כולו מיועד למפתחים ולחוקרים. הוא לא פותר לכם תרגילים בשיעורי בית ולא מציע ממשק צ'אט אישי ללימודים. אם אתם בונים שירות שמשלב חישובים ורוצים לדעת באיזה מודל לבחור, הלוח הזה נותן נתונים יבשים על ביצועים.

איך עובדת הבדיקה בפועל

הבדיקה מורכבת מחיבור של מודל דרך ממשק API, מודלים של Hugging Face, או קוד פתוח בהתאמה אישית. הבחינה עצמה רצה בשני אופנים, הערכה ללא דוגמאות מוקדמות או עם מספר דוגמאות בודדות. המבחנים מחולקים לקטגוריות ברורות של בעיות מילוליות באנגלית, בעיות מילוליות בסינית ותרגילי חשבון טהורים. האתר משתמש במאגרים ידועים כמו GSM8K לצד מאגרים כמו Arith3K וערכות מבחנים ממשלתיות מסין.

סוגי המבחנים העיקריים

  1. 01שאלות מילוליות באנגלית
  2. 02בעיות מילוליות בסינית
  3. 03חישובי אריתמטיקה טהורה
  4. 04מבחני קבלה ממשלתיים
  5. 05תחרויות מתמטיקה לתלמידים

מה שבאמת מפריע כאן הוא הריכוז הכבד סביב השוק הסיני. חצי ממאגרי הבעיות המילוליות מגיעים ישירות ממערכת החינוך בסין, כולל מבחני GAOKAO מרובי שנים. אם אתם עובדים באנגלית, יש שם מאגרים מעולים כמו MATH וגם GSM8K. לעומת זאת, עברית בכלל לא קיימת שם. אם המודל שלכם צריך להתמודד עם שאלות בעברית, הנתונים באתר הזה לא יעזרו לכם בכלל. תצטרכו להקים מבחן עצמאי משלכם.

זה שווה את זה רק אם אתם מאמנים מודל ייעודי ורוצים להיכנס לדירוג העולמי. מעבר לזה, מדובר במאגר נתונים לקריאה בלבד.

כמה זה עולה ומי ממן

האתר לא מציג מחירון רשמי ולא דורש דמי מנוי. לפי המידע בעמוד הראשי, כוח החישוב של הפרויקט כולו מסופק ללא עלות על ידי פלטפורמת החדשנות הלאומית לחינוך חכם בבינה מלאכותית בסין. כדי להכניס מודל חדש לבדיקה או לתאם שיתוף פעולה, צריך לפנות למייל שמסתיים בכתובת של ג'ימייל ולא דרך מערכת אוטומטית שקופה. זה נראה כמו מיזם אקדמי מחקרי יותר מאשר שירות מסחרי מסודר.

אין פה מסלולי תשלום. אין כרטיס אשראי.

  • מחירון באתרלא צוין כלל
  • כוח חישובמסופק בחינם מגוף חיצוני
  • תמיכה בעבריתאין מאגרים בעברית

לא הייתי משתמש בזה כדי לקבל החלטה על מודל לשירות לקוחות או לכתיבה יוצרת. הכלי הזה בודק אך ורק לוגיקה מספרית ופתרון שלבי. מודלים מסוימים שמצטיינים בטבלה הזו עשויים להיות גרועים לחלוטין בניסוח טקסט חופשי. הם עוברים אימון ייעודי למתמטיקה, כמו WizardMath או Llemma, שמתמחים בתחום הזה בלבד. לכן הדירוג הזה רלוונטי רק כאינדיקציה ליכולת חישוב טהורה.

התוצאות מתעדכנות באופן ידני. ביוני 2024 נוספו לשם גרסאות שונות של Qwen2 ומבחני GAOKAO של אותה שנה, לצד מודלים ותיקים יותר. לכן, אם אתם מחפשים את הבדיקות על הגרסאות הכי חדשות שיצאו החודש, סביר להניח שהן עדיין לא שם. תצטרכו להמתין לעדכון הבא של החוקרים שמנהלים את הדף, או להריץ את הקוד בעצמכם מתוך המאגר שלהם ב־GitHub.

מה MathEval
עושה

הפרויקט מריץ מודלים מול מבחנים שונים בתצורות של בדיקה ישירה ללא דוגמאות או בדיקה עם דוגמאות בודדות. מודדים את התוצאות מול מאגרים מוכרים כמו GSM8K, MATH, ומבחני בגרות ותחרויות מסין כמו GAOKAO.

אפשר לבדוק מודלים ידועים כמו סדרת GPT או LLaMA, וגם מודלים מתמחות ייעודיים. הנתונים מתעדכנים עם מבחנים חדשים ומודלים עדכניים שמתווספים ללוח התוצאות הציבורי.

כמה זה
עולה

האתר לא מפרסם מחיר. המיזם מציין כי כוח החישוב מסופק ללא עלות על ידי פלטפורמת חדשנות לאומית בתחום החינוך החכם, ומי שרוצה להצטרף להערכה או לבדוק מודל משלו פונה אליהם בדואר אלקטרוני.

למי זה
מתאים

חוקרים, מפתחי מודלים ומהנדסי אלגוריתמים שרוצים מדד מדויק ליכולות החישוב וההסקה של מודל שפה לפני שהם משלבים אותו במערכות שלהם.

מי שמחפש כלי שעוזר לפתור שיעורי בית, לחשב נתונים בעבודה או לתרגל מבחנים לא ימצא כאן מענה. זה כלי מדידה למפתחים, לא מחשבון ולא מורה פרטי.

מה לבדוק
לפני שמתחייבים

האתר מוצג בסינית וחלק גדול ממאגרי השאלות מבוסס על תוכניות לימודים ומבחנים בסין. כדאי לבדוק אם המבחנים באנגלית רלוונטיים לסוג הבעיות שאתם חוקרים, ולקחת בחשבון שאין באתר התייחסות למבחנים בעברית או תמיכה מקומית. בנוסף, הקוד והנתונים מנוהלים דרך גיטהאב ופנייה במייל, כך שאין כאן ממשק שירות עצמי מסודר או התחייבות לזמני בדיקה.

מה MathEval
פרסמו בקוד פתוח

MathEval מפרסמים גם מודלים פתוחים שאפשר להוריד ולהריץ. אלה הגדולים שבהם לפי מספר ההורדות ב־Hugging Face.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על MathEval כאן. אם השתמשתם בMathEval, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה MathEval
אומר על עצמו

MathEval是一个专注于全面评估大模型数学能力的测评基准。共包含22个数学领域测评集和近30K道数学题目,旨在全面评估大模型在包含算术,小初高竞赛和部分高等数学分支在内的各阶段、难度和数学子领域的解题能力表现,既可以作为现阶段大模型之间数学能力横向对比的一站式参考,也可以为后续如何进一步提高大模型数学能力指引方向。

מהאתר של MathEval, נקרא ב־2026-09-08. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

איזה סוגי מודלים אפשר לחבר לבדיקה?

אפשר לחבר מודלים פתוחים ממאגר Hugging Face, מודלים מסחריים באמצעות ממשק API, או מודלים מקומיים בקוד פתוח שהגדרתם בעצמכם.

באילו שפות השאלות במאגר?

השאלות מחולקות לשתי קבוצות עיקריות, אנגלית וסינית. המאגר באנגלית כולל מבחנים מוכרים כמו GSM8K ו־MathQA, והמאגר בסינית כולל שאלות ממבחני GAOKAO ומאגרים מקומיים.

מה MathEval עושה?

מאגר מבחנים שבודק ביצועים של מודלי שפה בפתרון בעיות מתמטיות. הוא כולל כמעט 30,000 שאלות שמחולקות לעשרים מאגרי נתונים שונים, החל מחשבון בסיסי ועד לתחרויות ומתמטיקה גבוהה. בניגוד למבחנים כלליים של בינה מלאכותית, הפרויקט מתמקד אך ורק בחשיבה כמותית. הוא מאפשר לחבר מודלים מפיתוח עצמי, מודלים פתוחים ממאגרים כמו Hugging Face, או מודלים מסחריים דרך ממשקי תכנות, ולראות טבלת הישגים מסודרת.

האם MathEval חינמי?

באתר של MathEval לא נמצא מידע ברור על תמחור בזמן הבדיקה (2026-09-08).

האם MathEval תומך בעברית?

האתר של MathEval מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־MathEval?

כן. באתר יש 101 כלים בקטגוריית מודלים ותשתית, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמודלים ותשתית

כל 101 הכלים
  • הלוגו של Metorial יש מסלול חינם

    Metorial

    מחבר סוכני בינה מלאכותית למאות מערכות ארגוניות תחת שכבת אבטחה וניהול הרשאות.

    מודלים ותשתית metorial.com
  • הלוגו של Midjourney לא צוין

    Midjourney

    פיתוח מודלים של בינה מלאכותית ליצירת תמונות ווידאו.

    מודלים ותשתית midjourney.com
  • הלוגו של milvus קוד פתוח

    milvus

    בסיס נתונים וקטורי בקוד פתוח לחיפוש מהיר ועבודה עם יישומי בינה מלאכותית.

    מודלים ותשתית milvus.io
  • הלוגו של MiniMax בתשלום

    MiniMax

    בית מודלים רב־מודאלי, טקסט, קול ווידאו, עם מוצרים לצרכן ו־API.

    מודלים ותשתית minimax.io
  • הלוגו של MiniMax API Platform קוד פתוח

    MiniMax API Platform

    ממשק פיתוח למודלי שפה, יצירת וידאו ודיבור בקוד אחד.

    מודלים ותשתית platform.minimax.io
  • הלוגו של Mistral בתשלום

    Mistral

    בית מודלים אירופי שמשחרר חלק ממודליו בקוד פתוח, עם פלטפורמה ארגונית.

    מודלים ותשתית mistral.ai