GPT

מחקר וחיפוש · קוד פתוח

הלוגו של vellum leaderboard

vellum leaderboard

טבלת ביצועים ציבורית שמרכזת נתונים על מודלי שפה שיצאו מאז אפריל 2024. המידע מגיע ישירות מספקי המודלים ומבדיקות עצמאיות של החברה וקהילת הקוד הפתוח, בלי מבחנים מיושנים כמו MMLU שאיבדו רלוונטיות.

ההבדל המרכזי כאן הוא החלוקה למשימות עבודה מוגדרות היטב. במקום לתת רק ציון כללי, רואים תוצאות במבחנים ייעודיים לתכנות, שימוש במחשב, עבודה מול טרמינל, סיכום דפדפן ומשימות אוטומציה.

  • מחקר וחיפוש
  • קוד פתוח
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
קוד פתוח
קטגוריה
מחקר וחיפוש
שפת האתר
אנגלית
כתובת
vellum.ai
נבדק
2026-09-08

הסקירה

האתר של Vellum מציג טבלת ביצועים פומבית של מודלי שפה, עם דגש על מבחנים שפורסמו אחרי אפריל 2024. הוא מסנן החוצה מבחנים ישנים כמו MMLU ומציג ציונים במבחנים מורכבים כמו GPQA Diamond לחשיבה או SWE Bench לתכנות. המטרה היא להראות איזה מודל מוביל בכל משימה ספציפית במקום להסתפק בציון כללי יחיד. הנתונים מגיעים ישירות מיצרניות המודלים, מבדיקות עצמאיות של החברה עצמה ומתרומות של קהילת הקוד הפתוח.

במקום למדוד רק ידע כללי שנשחק עם הזמן, הבדיקות כאן מתמקדות במשימות עבודה ממשיות. במבחן Humanity's Last Exam המודלים המובילים מגיעים רק לאזור 65 אחוזי הצלחה, מה שמעיד על מבחן קשה במיוחד. לצד יכולות חשיבה יש פילוח נפרד של הפעלת מחשב, ניהול שורת פקודה ומהירות הפקת טוקנים.

איך עובד לוח התוצאות

הטבלה מדרגת מודלים לפי תחומים מוגדרים היטב. אם אתם מחפשים אוטומציה של תהליכי עבודה, תוכלו לראות את AutoBench, שבו GLM-5.3-Flash מוביל עם 48.8 אחוזים. אם המטרה שלכם היא שימוש במסוף פקודות, המבחן הרלוונטי הוא Terminal-Bench 2.1 ושם GPT-5.6 Sol מוביל עם 88.8 אחוזים. הערך של הלוח הזה תלוי ביכולת שלכם להתאים את המבחן המדויק לבעיה האמיתית שאתם מנסים לפתור. לא הייתי משתמש בציון הכללי כדי לבחור מודל למוצר ספציפי. הבדלי המהירות עצומים. Llama 4 Scout מפיק 2600 טוקנים בשנייה, פי כמה מכל מודל מסחרי גדול.

מדדי ביצועים עיקריים בלוח

  1. 01דירוג כללי של מבחנים קשים
  2. 02מדידת חשיבה בדרגת קושי גבוהה
  3. 03בדיקת כתיבת קוד עצמאית
  4. 04הערכת ביצוע פעולות במחשב
  5. 05בדיקת מהירות הפקת טוקנים
  6. 06השוואת עלויות למיליון טוקנים

זה עניין של התאמה.

הלוח הזה מתאים לצוותי פיתוח, לחוקרים ולאנשי מוצר שמתלבטים איזה מודל לחבר לתשתית שלהם לפי פרמטרים של מחיר, מהירות וסוג המשימה. הוא מיועד למי שכבר מכיר את שמות המבחנים ויודע מה ההבדל בין זמן לתגובה ראשונה לבין קצב יצירת טקסט. הוא ממש לא מתאים למי שמחפש צ'אט בוט פשוט לשימוש משרדי שגרתי. אין כאן שום מידע על עברית. כל הבנצ'מרקים המוצגים מבוססים על אנגלית וקוד, כך שאין שום דרך לדעת מהטבלה איך המודלים יתפקדו בשפה מקומית.

מה הקשר בין הלוח למחיר

הלוח עצמו פתוח לעיון חופשי ברשת, אך הוא יושב בתוך אתר שמציע תשתית עוזר אישי בתשלום. מסלול Mighty מתחיל ב־30 דולר לחודש וכולל מחשב בסיסי עם מעבד אחד, 2 גיגה זיכרון ואחסון של 10 גיגה. המסלול הבא, Super, עולה 100 דולר לחודש, מקפיץ את המפרט ל־2.5 מעבדים עם 30 גיגה אחסון, ומסלול Ultra מגיע ל־200 דולר לחודש עם 4 מעבדים. ההבדל במחיר נובע ישירות מכוח המחשוב שמוקצה לכם, מנפח הדיסק ומחבילת הקרדיטים.

עבור רוב האנשים שרק בוחנים ביצועי מודלים, אין שום צורך לשלם על המסלולים האלה. שימו לב שיש גם דמי פלטפורמה של 10 דולר לחודש בחלק מהאפשרויות, והפעולות עצמן צורכות קרדיטים לפי שימוש שבהם דולר אחד שווה קרדיט בודד. מי שרוצה שליטה מלאה יכול להוריד את קוד העוזר מגיטהאב ולהריץ אותו באופן עצמאי על חומרה משלו ללא תשלום חודשי.

  • צפייה בלוחחינם וללא הרשמה
  • בדיקות בעבריתלא קיימות כלל
  • קוד תשתיתפתוח להרצה עצמית

הנתונים מתעדכנים לעיתים קרובות.

לפני שאתם מקבלים החלטה ארכיטקטונית על בסיס הטבלה הזו, קחו בחשבון שהיא מתעלמת משיקולי פריסה מקומית ואינה מודדת תמיכה בלשנית מעבר לאנגלית. עלויות המודלים בטבלה, כמו Nova Micro שעולה 0.04 דולר לקלט ו־0.14 דולר לפלט למיליון טוקנים, נראות מפתות על הנייר. עם זאת, איכות הפלט בפועל במשימה שלכם עשויה להיות רחוקה מתוצאות המבחן הסינתטי.

מה vellum leaderboard
עושה

הלוח מדרג מודלים לפי מבחני ביצועים ספציפיים ומציג אחוזי הצלחה מדויקים בכל תחום. אפשר לראות תוצאות במבחנים כמו SWE Bench לתכנות סוכנים, GPQA Diamond לחשיבה לוגית, OSWorld לשליטה בממשק מחשב, ו־AutoBench לאוטומציות של עבודה משרדית.

בנוסף למבחני יכולת, מוצגים מדדים טכניים שוטפים על עלויות וזמנים. אפשר למצוא שם מהירות הפקה במונחי טוקנים לשנייה, זמני השהיה של טוקן ראשון בשניות, ותמחור רשמי למיליון טוקנים של קלט ופלט.

כמה זה
עולה

הגישה לטבלת ההשוואה פתוחה ואינה דורשת תשלום באתר. המוצר הנלווה שהחברה מציעה מתחיל בגרסת קוד פתוח בהתקנה עצמית ללא דמי שימוש, בעוד מסלולי הענן המנוהלים מתחילים מ־30 דולר לחודש ומגיעים ל־100 ול־200 דולר, בהתאם לגודל השרת, הנפח וכמות הקרדיטים.

קוד פתוח $30/month$100/month$200/month$10/mo

המספרים נקראו מעמוד התמחור של vellum leaderboard ב־2026-09-09. תמחור משתנה. לפני החלטה כדאי לפתוח את עמוד התמחור עצמו.

למי זה
מתאים

הטבלה מיועדת למפתחים, חוקרים ומנהלי מוצר שצריכים לבחור מודל שפה למשימה טכנית ספציפית ומחפשים נתונים עדכניים על מהירות, זמני תגובה ועלויות טוקנים.

מי שרק מחפש ממשק צ'אט פשוט לשימוש יומיומי או כתיבת טקסטים קצרים לא צריך את זה. הנתונים מתמקדים באופטימיזציה של פיתוח וסוכנים, ואינם רלוונטיים למשתמש ביתי רגיל.

מה לבדוק
לפני שמתחייבים

לפני שבוחרים מודל על בסיס הטבלה הזו, צריך לזכור שאין בה שום בדיקה או מדד שנוגעים לעברית. מודל שמצטיין במבחני קוד או אוטומציה באנגלית עלול לקרוס בניתוח שפה מקומית, בעיות כיווניות או עלויות טוקנים כפולות בשפות שאינן אנגלית.

בנוסף, הנתונים מתבססים בחלקם על דיווחי הספקים עצמם ולא רק על הרצות בלתי תלויות. המהירויות וזמני ההשהיה שמפורטים שם לא משקפים בהכרח את החיבור שלכם מהארץ מול השרתים הזרים של כל ספק.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על vellum leaderboard כאן. אם השתמשתם בvellum leaderboard, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה vellum leaderboard
אומר על עצמו

Compare the latest AI models, from OpenAI, Anthropic, Google and open source models like Kimi 5.2, MiniMax and others. Updated rankings across reasoning, browser and computer use, coding, automation, with pricing and speed data.

מהאתר של vellum leaderboard, נקרא ב־2026-09-08. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

האם המבחנים כוללים מודלים ישנים?

לא. המדידות מתמקדות בגרסאות שיצאו לשוק החל מאפריל 2024, ומסננות החוצה מבחנים רווים שלא מאפשרים להבדיל בין מודלים מתקדמים.

איזה מדדים מוצגים לגבי ביצועי זמן ומהירות?

יש מדידה של קצב יצירת טוקנים לשנייה ומדידת זמן ההמתנה לקבלת הטוקן הראשון בשניות, לצד עלויות מפורטות למיליון טוקנים.

מה vellum leaderboard עושה?

טבלת ביצועים ציבורית שמרכזת נתונים על מודלי שפה שיצאו מאז אפריל 2024. המידע מגיע ישירות מספקי המודלים ומבדיקות עצמאיות של החברה וקהילת הקוד הפתוח, בלי מבחנים מיושנים כמו MMLU שאיבדו רלוונטיות. ההבדל המרכזי כאן הוא החלוקה למשימות עבודה מוגדרות היטב. במקום לתת רק ציון כללי, רואים תוצאות במבחנים ייעודיים לתכנות, שימוש במחשב, עבודה מול טרמינל, סיכום דפדפן ומשימות אוטומציה.

האם vellum leaderboard חינמי?

לפי מה שהאתר של vellum leaderboard מפרסם, קוד פתוח. תנאים משתנים. כדאי לאמת מול עמוד התמחור שלו.

האם vellum leaderboard תומך בעברית?

האתר של vellum leaderboard מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־vellum leaderboard?

כן. באתר יש 117 כלים בקטגוריית מחקר וחיפוש, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמחקר וחיפוש

כל 117 הכלים
  • הלוגו של vespa.ai תקופת ניסיון

    vespa.ai

    מנוע חיפוש ודירוג המשלב וקטורים, טקסט ונתונים מובנים עם מודלים של למידת מכונה

    מחקר וחיפוש vespa.ai
  • V יש מסלול חינם

    VisualWebArena

    סביבת מבחן להערכת סוכני בינה מלאכותית על משימות אינטרנט שדורשות הבנה חזותית.

    מחקר וחיפוש jykoh.com
  • הלוגו של vizologi.com בתשלום

    vizologi.com

    מחולל תוכניות עסקיות, ניתוחי שוק ומצגות אסטרטגיות על בסיס מאגר מודלים קיימים.

    מחקר וחיפוש vizologi.com
  • הלוגו של Voicesphere לא צוין

    Voicesphere

    חיפוש ושאלות בדיבור או בהקלדה מתוך מסמכים וקבצי וידאו.

    מחקר וחיפוש voicesphere.co
  • הלוגו של Way To AGI לא צוין

    Way To AGI

    מרכז משאבים וקהילה בסינית לחיפוש כלים, פרומפטים ומידע על בינה מלאכותית.

    מחקר וחיפוש blog.waytoagi.com
  • הלוגו של We must stop AI replicating the problems of surveillance capitalism בתשלום

    We must stop AI replicating the problems of surveillance capitalism

    מאמר דעה של רנה פורהאר על הצורך ברגולציה וגילוי נתונים כלכליים של בינה מלאכותית.

    מחקר וחיפוש ft.com