GPT

מחקר וחיפוש · לא צוין

C

C-Eval Benchmark

מדובר במאגר נתונים ומערך מבחנים שנועד לבדוק ביצועים של מודלי שפה בסינית. בעבר האתר ניהל לוח תוצאות רשמי, אבל הצוות סגר אותו והפסיק לקבל הגשות.

מה שמייחד את הפרויקט הזה הוא המיקוד המוחלט בידע וביכולות בשפה הסינית בתחומי מדעים, מדעי החברה ומדעי הרוח, בניגוד למבחנים מערביים שמודדים בעיקר אנגלית.

  • מחקר וחיפוש
  • לא צוין
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
לא צוין
קטגוריה
מחקר וחיפוש
שפת האתר
אנגלית
כתובת
cevalbenchmark.com
נבדק
2026-09-09

הסקירה

מורידים את סט המבחנים ישירות מתוך Huggingface ומריצים אותו מול מודל השפה שלכם. האתר cevalbenchmark.com מציג לוח תוצאות שמשווה ביצועים של עשרות מודלים שונים במבחנים מרובי תחומים. בעבר המפתחים שמרו את סט הבדיקה סגור כדי למנוע דליפת נתונים, והמשתמשים נדרשו להעלות חיזויים לאתר כדי לקבל ציונים. המצב הזה השתנה לחלוטין. הלוח הוקפא רשמית, והצוות שחרר את כל השאלות לציבור הרחב לשימוש עצמאי.

הפרויקט הזה אינו שירות חיפוש רגיל ואינו עוזר כתיבה למשרד. אם אתם מחפשים כלי עבודה שיענה לכם על שאלות ביומיום או יסכם מסמכים בעברית, הגעתם למקום הלא נכון. המאגר מכיל שאלות ומבחנים שנועדו לבחון יכולות של מודלים בסינית ובאנגלית. עברית כלל אינה מופיעה שם. זהו כלי הערכה שמיועד למי שמפתח, מאמן או בוחן מודלי שפה, ולא למשתמשי קצה רגילים. כל מי שבונה מודל ורוצה לדעת איפה הוא עומד מול המתחרים מקבל כאן נקודת ייחוס ברורה ומפורטת.

מה בודקים המבחנים בפועל

הערכת הביצועים מתבצעת על פני ארבעה תחומים מרכזיים. המערך בודק יכולות במקצועות מדעים וטכנולוגיה, מדעי החברה, מדעי הרוח ומקצועות נוספים. הציונים מוצגים בממוצע כללי וגם בממוצע מיוחד לשאלות ברמת קושי גבוהה. הנתונים נאספים משתי שיטות בדיקה, הנחיה ללא דוגמאות או הנחיה עם דוגמאות בודדות. מודלים כמו Spark4.0 Max הגיעו לממוצע של 91.8 נקודות, בעוד מודלים מוכרים מהמערב הציגו תוצאות נמוכות בהרבה.

התוצאות במבחן הזה מפתיעות מתכנתים שלא מכירים את הזירה הסינית. GPT-4 של חברת OpenAI קיבל במבחן הזה ציון ממוצע של 68.7 בלבד בבדיקה שנערכה במאי 2023. מודל Claude-v1.3 של Anthropic נעצר על 54.2 נקודות, וגרסת הבסיס של ChatGPT קיבלה 54.4 נקודות. הסיבה לפער נעוצה בשפה ובאופי השאלות. מודלים סיניים כמו YAYI-Ultra או TeleChat2-115B עוקפים אותם בקלות בטבלה. המבחן הזה פשוט מותאם לעולם הידע ולשפה הסינית.

הבדיקות המערביות לא מספרות את כל הסיפור.

מרכיבי הציון בלוח המבחנים

  1. 01בדיקת מקצועות הנדסה ומדעים מדויקים
  2. 02בחינת ידע במדעי הרוח
  3. 03מדידת ידע במדעי החברה
  4. 04חישוב ממוצע שאלות ברמת קושי גבוהה

סגירת האתר ומשמעות הנתונים

העדכון מתאריך 2025/07/26 קבע עובדה ברורה. מפעילי האתר הודיעו שהם מפסיקים לתחזק את לוח התוצאות, ובעתיד יסירו את החלק הזה מהאתר לחלוטין. בעבר חלק מהמודלים נבדקו בידי צוות הפרויקט וחלקם התבססו על תוצאות שהמשתמשים שלחו בעצמם. כעת, כשהמבחנים פתוחים לכל דורש ברשת, אין יותר פיקוח על אמינות הבדיקה. אתם מורידים את הקבצים ובודקים את עצמכם על המחשב שלכם.

לא הייתי משתמש בזה לצורך השוואת ביצועים עבור יישומים מקומיים בישראל.

לגבי תשלום, המצב פשוט לחלוטין. אין שום מחירון, מסלול מנוי או תשלום באתר, משום שהאתר כלל אינו מוכר שירות. כל הנתונים, הגישה לטבלה וקובצי המבחנים בשרתי Huggingface פתוחים לגמרי בלי חיוב. תצטרכו לשלם רק על כוח המחשוב שלכם או על קריאות API למודל שאתם מעוניינים להריץ מול המבחן.

  • מחירון באתרלא צוין מחיר
  • תחזוקת לוחהופסקה לצמיתות
  • גישה למבחניםהורדה חופשית מלאה

הלוח מכיל מעל חמישים מודלים שונים מגוון רחב של מפתחים. תמצאו שם מודלים מבוססי משקולות פתוחות כמו Qwen-72B של חברת Alibaba Cloud או סדרת Yi-34B, לצד מודלים סגורים הזמינים דרך ממשק רשת או API בלבד. המגוון הזה מאפשר למפתחים לבדוק איזה גודל של ארכיטקטורה מספק את התוצאה הטובה ביותר ביחס למשאבים הדרושים להרצה שלו.

מה C-Eval Benchmark
עושה

בעבר המשתמשים הריצו את המודל שלהם מול השאלות, שלחו את קובץ התוצאות לאתר וקיבלו ציון בלוח הציבורי. כיום הלוח לא מתעדכן יותר, והצוות הפך את כל ערכת המבחנים לציבורית.

אתם מורידים את הקבצים ישירות מפלטפורמת Huggingface ומריצים את הבדיקה אצלכם באופן עצמאי. המבחנים כוללים פרומפטים מסוג אפס דוגמאות או דוגמאות בודדות, והציונים מחושבים לפי דיוק כללי, ציון שאלות קשות, וחלוקה לקטגוריות שונות.

כמה זה
עולה

האתר לא מפרסם מחיר ולא גובה תשלום על השימוש. מאגר המבחנים עצמו זמין להורדה חופשית דרך פלטפורמת Huggingface ללא עלות מצד מפתחי הפרויקט, כך שרוב הקוראים יוכלו להוריד אותו ישירות למחשב שלהם בחינם לגמרי.

למי זה
מתאים

זה מתאים לחוקרי בינה מלאכותית, מפתחי מודלי שפה וצוותי הנדסה שרוצים לבדוק איך המודל שלהם מתמודד עם השפה הסינית ועם תחומי ידע אקדמיים שונים.

זה ממש לא מתאים למי שמחפש כלי עבודה יומיומי, צ'אטבוט או ממשק לניהול משימות. אם המטרה שלכם היא להעריך מודלים בעברית או באנגלית, אין לכם מה לחפש כאן.

מה לבדוק
לפני שמתחייבים

קחו בחשבון שהאתר הודיע רשמית ביולי 2025 על הפסקת התחזוקה של לוח התוצאות, והוא צפוי להסיר אותו לחלוטין בעתיד. מעבר לזה, מכיוון שערכת המבחנים פורסמה לציבור הרחב בגישה פתוחה, קיים סיכון גבוה לדליפת הנתונים לתוך סטים של אימון, מה שעלול לנפח ציונים של מודלים חדשים ולפגוע באמינות ההשוואה. אין כאן שום תמיכה בעברית.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על C-Eval Benchmark כאן. אם השתמשתם בC-Eval Benchmark, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה C-Eval Benchmark
אומר על עצמו

Leaderboard | C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models

מהאתר של C-Eval Benchmark, נקרא ב־2026-09-09. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

האם אפשר עדיין להגיש תוצאות של מודל חדש ללוח?

לא. הצוות הפסיק לעדכן את לוח התוצאות ביולי 2025 והודיע שלא יקבל יותר קובצי תחזיות של משתמשים.

איפה מוצאים את קובצי המבחן עצמם?

ערכת המבחנים כולה שוחררה לציבור וניתנת להורדה ישירה דרך מאגר הנתונים של הפרויקט ב־Huggingface.

מה C-Eval Benchmark עושה?

מדובר במאגר נתונים ומערך מבחנים שנועד לבדוק ביצועים של מודלי שפה בסינית. בעבר האתר ניהל לוח תוצאות רשמי, אבל הצוות סגר אותו והפסיק לקבל הגשות. מה שמייחד את הפרויקט הזה הוא המיקוד המוחלט בידע וביכולות בשפה הסינית בתחומי מדעים, מדעי החברה ומדעי הרוח, בניגוד למבחנים מערביים שמודדים בעיקר אנגלית.

האם C-Eval Benchmark חינמי?

באתר של C-Eval Benchmark לא נמצא מידע ברור על תמחור בזמן הבדיקה (2026-09-09).

האם C-Eval Benchmark תומך בעברית?

האתר של C-Eval Benchmark מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־C-Eval Benchmark?

כן. באתר יש 117 כלים בקטגוריית מחקר וחיפוש, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמחקר וחיפוש

כל 117 הכלים
  • הלוגו של Can Computers Create Art? by Aaron Hertzmann לא צוין

    Can Computers Create Art? by Aaron Hertzmann

    מאמר עיוני מאת אהרון הרצמן שבוחן אם מחשבים מסוגלים ליצור אמנות.

    מחקר וחיפוש mdpi.com
  • הלוגו של CFRexplorer לא צוין

    CFRexplorer

    עונה לטייסים על שאלות בתקנות התעופה האמריקאיות.

    מחקר וחיפוש cfrexplorer.com
  • הלוגו של Challenging The Myths of Generative AI | TechPolicy.Press לא צוין

    Challenging The Myths of Generative AI | TechPolicy.Press

    פרק פודקאסט ותמליל שמנתחים מה בינה מלאכותית יכולה לעשות ומה סתם אשליה.

    מחקר וחיפוש techpolicy.press
  • הלוגו של ChatGPT is fun, but not an author | Science בתשלום

    ChatGPT is fun, but not an author | Science

    מאמר אקדמי מכתב העת Science שבוחן את השפעת הבינה המלאכותית על תהליכי יצירה.

    מחקר וחיפוש science.org
  • הלוגו של CiteMe יש מסלול חינם

    CiteMe

    הופך DOI, ISBN, כתובת או כותרת לציטוט בכל אחד מ־60 סגנונות.

    מחקר וחיפוש citeme.app
  • הלוגו של CodeArena Leaderboard לא צוין

    CodeArena Leaderboard

    השוואה ודירוג של מודלי קוד פתוחים לפי הצבעות משתמשים וקרבות ישירים.

    מחקר וחיפוש llmcodearena.com