GPT

מודלים ותשתית · קוד פתוח

הלוגו של LLMEval

LLMEval

יוזמת מחקר של מעבדת FDU-NLP בוחנת מודלי שפה גדולים מול מבחני ביצועים מורכבים במיוחד. הפרויקט מציע מאגרי שאלות ברמה אקדמית, תרחישים קליניים מעולמות הרפואה ומבחני לוגיקה שמקשים מאוד על המודלים הקיימים.

ההבדל המשמעותי מול בדיקות רגילות הוא המאבק בזיהום נתונים. הם מחזיקים חלק ניכר מהשאלות במאגר פרטי וסגור כדי למנוע ממפתחי המודלים לאמן עליהן מראש, ומאמתים תשובות לוגיות בעזרת סולבר Z3 ולא רק בהסתמכות על טקסט חופשי.

  • מודלים ותשתית
  • קוד פתוח
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
קוד פתוח
קטגוריה
מודלים ותשתית
שפת האתר
אנגלית
כתובת
llmeval.com
נבדק
2026-09-08

הסקירה

חוקרי Fudan NLP Lab מריצים מודלי שפה מול מאגר שאלות סגור כדי לבדוק מתי המודל באמת חושב ומתי הוא פשוט שינן תשובות. הפרויקט הזה, LLMEval, מרכז מבחני ביצועים שמנסים להתמודד עם בעיית הזיהום שבה מודלים נבחנים על טקסטים שכבר קראו באינטרנט. הם בנו תשתית שמשלבת מאגר של 220,000 שאלות ברמת תארים מתקדמים בתוך 13 תחומי ידע שונים, לצד מבחנים קליניים ייעודיים לעולם הרפואה ומבחני לוגיקה נוקשים. המערך כולו מיועד למדוד דיוק אמיתי של מערכות בינה מלאכותית בתנאי מעבדה מבוקרים.

המטרה העיקרית כאן היא מניעת רמאויות של מודלים. כדי להשיג את זה, החוקרים לא מפרסמים את כל השאלות ברשת. במבחן הלוגיקה שלהם, שנקרא LLMEval-Logic, הם משחררים לציבור רק 80 אחוזים מהנתונים, ואת 20 האחוזים הנותרים שומרים במאגר פרטי חתום. אם אתם בונים מודל שפה ורוצים להוכיח שהתוצאות שלכם אמיתיות, המאגר החבוי הזה מונע מהנתונים לחלחל לתוך שלב האימון של המודל. זה רעיון פשוט שעובד היטב.

איך עובדים מבחני הלוגיקה והרפואה

מבחן הלוגיקה בנוי מסיפורים אמיתיים שתורגמו לנוסחאות ולא מתבניות מתמטיות יבשות שנפלטו בצורה אוטומטית. תהליך הבדיקה משתמש בפותר המשוואות Z3 כדי לאמת שכל תרגום משפה טבעית לתחשיב פסוקים ותחשיב יחסים הוא מדויק לחלוטין ברמת הפסוק הבודד. נוסף על כך, סוכן בדיקה ייעודי ניפה החוצה שאלות שהתבררו כקלות מדי עבור המערכות. התוצאה היא 196 פריטים בסיסיים ו־154 שאלות קשות במיוחד שמכסות תרחישים של מנייה, ייחודיות ומחשבה נגדית. אפילו מודלי הקצה המובילים הגיעו שם לדיוק של 37.5 אחוזים בלבד.

המבחן קשה בכוונה.

בצד הרפואי, המבחן LLMEval-Med נשען על 2,996 שאלות שנלקחו מתוך רשומות רפואיות אלקטרוניות אמיתיות ומתרחישים קליניים שנוסחו בידי רופאים מומחים. הבדיקה מדרגת 13 מודלים בחמישה תחומים מוגדרים: ידע רפואי, הבנת שפה, הנמקה, אתיקה ובטיחות, ויצירת טקסט קליני. במקום להסתמך רק על בדיקה ממוחשבת פשוטה, התהליך כולל מודל שמתפקד כשופט ומכויל מול מומחים אנושיים עד להגעה להסכמה של 90 אחוזים ביניהם. מי שמחפש מבחן שטחי עם שאלות אמריקאיות קצרות יגלה שכאן מדובר באתגר רפואי כבד ומעמיק.

הרופאים בודקים כל תשובה.

בדיקות המערכת בפועל

  1. 01אימות לוגיקה בעזרת Z3
  2. 02דגימת שאלות דינמית ממאגר
  3. 03הקשחת נתונים מול מודלים
  4. 04שיפוט אוטומטי מבוסס מומחים

למי הכלי מתאים ולמי לא

הפרויקט הזה מיועד בראש ובראשונה לחוקרי למידת מכונה ולצוותי פיתוח שמאמנים מודלי שפה מאפס או מבצעים כוונון עדין על ארכיטקטורות קיימות. זה שווה את זה רק אם אתם מפתחים מודל וצריכים הוכחה מחקרית שההסקה שלו עובדת. אם אתם מנהלי מוצר, אנשי שיווק או בעלי עסקים שמחפשים תוכנה שתסכם פגישות או תנהל משימות יומיות, אין לכם מה לחפש כאן. האתר כולו באנגלית, מבחני הלוגיקה מתמקדים בסינית, ועברית כלל אינה קיימת בחומרים האקדמיים שפורסמו.

  • קוד מקורפתוח בגיטהאב
  • תמיכה בעבריתלא קיימת
  • מחירון מלאלא מפורסם

הקוד והנתונים הבסיסיים זמינים בחינם ב־GitHub וב־Hugging Face ברישיון קוד פתוח. יחד עם זאת, מופיע תיוג של מסלול בתשלום באתר, אך ללא טבלת מחירים גלויה או פירוט עלויות עבור גישה ישירה למאגר השאלות המלא. לא הייתי משתמש בזה לפרויקטים שדורשים הערכה עסקית פשוטה, מפני שהתשתית דורשת משאבי מחשוב כבדים וידע טכני נרחב כדי להריץ את הצינורות במעבדה פרטית. אתם תצטרכו להשקיע שעות עבודה רבות רק כדי להתקין את הסביבה ולהריץ מבחן אחד.

זה דורש ידע טכני עמוק.

מה LLMEval
עושה

הבדיקה נשענת על כמה מאגרים ייעודיים. בבדיקות הלוגיות, שאלות נכתבות מתוך סיפורים אמיתיים, מתורגמות ללוגיקה מסדר ראשון ומאומתות מול פותר משוואות ממוחשב כדי לוודא שאין טעויות בניסוח. שאלות קלות מדי נזרקות החוצה בתהליך קשיח כדי לאתגר מודלים חזקים, כשגם המובילים שבהם מגיעים לשיעורי דיוק נמוכים מאוד בחלקים המורכבים.

בתחום הכללי והרפואי, המערך דוגם שאלות מתוך מאגר של מאות אלפי פריטים אקדמיים או אלפי רשומות רפואיות אמיתיות שנבדקו בידי רופאים. שיפוט התשובות מתבצע באמצעות מודל שופט שעבר כיול קפדני ומגיע להתאמה של תשעים אחוזים מול מומחים אנושיים.

כמה זה
עולה

האתר מציג את הפרויקט כקוד פתוח לצד ציון אפשרות בתשלום, אך הוא לא מפרסם מחירון, מסלולים או עלויות כלשהן עבור שימוש במאגרים או בשירותיו. רוב הנתונים והקוד זמינים דרך גיטהאב ללא תשלום, ומי שצריך שיתוף פעולה מחקרי או גישה מורחבת מתבקש ליצור קשר ישיר.

קוד פתוח

המספרים נקראו מעמוד התמחור של LLMEval ב־2026-09-09. תמחור משתנה. לפני החלטה כדאי לפתוח את עמוד התמחור עצמו.

למי זה
מתאים

חוקרי בינה מלאכותית, צוותי פיתוח שבוחנים יכולות היסק עמוקות בארגונים, ומדעני נתונים שמפתחים יישומים לתחומי הרפואה ימצאו כאן מדדים אמינים בהרבה מעוד מבחן סטנדרטי שנשחק.

מי שרק מחפש כלי עבודה יומיומי למשרד, ניהול משימות או שיפור כתיבה לא צריך לגעת בזה. מדובר בתשתית הערכה ומחקר טהורה ולא במוצר שמייצר תפוקה עסקית שוטפת.

מה לבדוק
לפני שמתחייבים

קחו בחשבון את מחסום השפה. חלק ניכר ממבחני הלוגיקה נבנה במקור בסינית, ושאר המאגרים מתמקדים באנגלית וברשומות רפואיות זרות. עברית כלל לא נבדקת כאן, כך שהתוצאות לא מלמדות דבר על איכות המודלים בשפה המקומית.

בנוסף, עשרים אחוזים ממאגרי השאלות נשארים חסויים לחלוטין אצל צוות המחקר בסין כדי למנוע זליגת נתונים, כך שאי אפשר לשחזר באופן מלא ועצמאי את כל תוצאות הבדיקה במחשב שלכם.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על LLMEval כאן. אם השתמשתם בLLMEval, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה LLMEval
אומר על עצמו

LLMEval is a research series dedicated to building comprehensive, fair, and robust evaluation frameworks for large language models.

מהאתר של LLMEval, נקרא ב־2026-09-08. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

האם אפשר להריץ את המבחנים האלה מקומית?

חלק מהקוד והנתונים זמין באופן חופשי להורדה דרך גיטהאב והאגינג פייס. עם זאת, המאגר המלא כולל חלקים סגורים המנוהלים ישירות על ידי המעבדה כדי לשמור על אמינות המבחנים.

כמה מודלים כבר נבדקו בפרויקט הזה?

האתר מציג השוואות שבוצעו על פני 59 מודלי שפה שונים, בהם מודלים מסחריים סגורים לצד גרסאות קוד פתוח מובילות.

האם השאלות הרפואיות מבוססות על נתונים אמיתיים?

המאגר הרפואי כולל כמעט 3,000 שאלות שנלקחו ישירות מתוך תיקים רפואיים אלקטרוניים ותרחישים קליניים שנוסחו ואומתו מול רופאים.

מה LLMEval עושה?

יוזמת מחקר של מעבדת FDU-NLP בוחנת מודלי שפה גדולים מול מבחני ביצועים מורכבים במיוחד. הפרויקט מציע מאגרי שאלות ברמה אקדמית, תרחישים קליניים מעולמות הרפואה ומבחני לוגיקה שמקשים מאוד על המודלים הקיימים. ההבדל המשמעותי מול בדיקות רגילות הוא המאבק בזיהום נתונים. הם מחזיקים חלק ניכר מהשאלות במאגר פרטי וסגור כדי למנוע ממפתחי המודלים לאמן עליהן מראש, ומאמתים תשובות לוגיות בעזרת סולבר Z3 ולא רק בהסתמכות על טקסט חופשי.

האם LLMEval חינמי?

לפי מה שהאתר של LLMEval מפרסם, קוד פתוח. תנאים משתנים. כדאי לאמת מול עמוד התמחור שלו.

האם LLMEval תומך בעברית?

האתר של LLMEval מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־LLMEval?

כן. באתר יש 101 כלים בקטגוריית מודלים ותשתית, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמודלים ותשתית

כל 101 הכלים
  • L בתשלום

    LLMLingua

    דחיסת פרומפטים ארוכים לחסכון בעלויות וזמני תגובה מול מודלי שפה.

    מודלים ותשתית llmlingua.com
  • הלוגו של LLMSTXT.NEW בתשלום

    LLMSTXT.NEW

    יוצר קובצי טקסט מרוכזים מאתרי אינטרנט לצורכי אימון מודלים והסקה.

    מודלים ותשתית llmstxt.new
  • הלוגו של LocalAI קוד פתוח

    LocalAI

    הרצת מודלי בינה מלאכותית מקומית על המחשב עם תאימות לממשקי ענן מוכרים

    מודלים ותשתית localai.io
  • הלוגו של LochBot יש מסלול חינם

    LochBot

    בדיקת פרומפטים מול דפוסי הזרקת הוראות ישירות בדפדפן וללא שליחת מידע לשרת.

    מודלים ותשתית lochbot.com
  • הלוגו של MathEval לא צוין

    MathEval

    השוואה והערכה של יכולות פתרון בעיות מתמטיות במודלי שפה שונים

    מודלים ותשתית matheval.ai
  • הלוגו של Metorial יש מסלול חינם

    Metorial

    מחבר סוכני בינה מלאכותית למאות מערכות ארגוניות תחת שכבת אבטחה וניהול הרשאות.

    מודלים ותשתית metorial.com