GPT
S

SPEED-Bench

קוד פתוח

nvidiaother2026-01-11

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

בנצ'מרק ייעודי למדידת ביצועי speculative decoding בסביבות הסקה אמיתיות. הוא נותן פילוח מדויק של קצב קבלת טוקנים ותפוקת מערכת תחת עומסי קלט משתנים.

  • 20,515הורדות בחודש
  • 45לייקים

מה זה

המאגר מציע שתי חלוקות עיקריות שנועדו לבחון היבטים שונים של מנגנוני ניחוש טוקנים. החלק הראשון מכוון למדידת איכות הניחוש וכולל 880 דוגמאות ב־11 קטגוריות תוכן, בהן תכנות, מתמטיקה, כתיבה יוצרת ותרגום. כדי להימנע מחזרתיות שקיימת במאגרים קודמים, המפתחים השתמשו במודל שיקוע של OpenAI כדי למדוד דמיון קוסינוס בין טקסטים ובחרו אלגוריתמית 80 דוגמאות מגוונות מכל תחום.

החלק השני מיועד לבדיקת תפוקת מערכת תחת קלטים באורכים קבועים של אלף עד 32 אלף טוקנים. הטקסטים בחלק זה נחתכו או רופדו במכוון כדי לייצר עלות חישוב אחידה, וחולקו לשלוש רמות אנטרופיה: נמוכה כמו השלמת קוד, בינונית וגבוהה כמו המשך דיאלוגים וספרים. במקום להשתמש ברצפי טוקנים אקראיים שמנפחים ביצועים באופן מלאכותי, הדאטה מסתמך על תוכן טבעי ממאגרים חיצוניים דוגמת פרויקט גוטנברג, Humanity's Last Exam ומאגרי קוד פתוח.

מתאים ל

  • הערכת מהירות speculative

    מדידת קצב קבלת הטוקנים של מודל מנחש מול מודל בסיס במגוון משימות שפה.

  • בדיקת תפוקת שרתים

    בחינת תפוקת מנועי הסקה תחת עומס קלטים ארוכים של עד 32 אלף טוקנים.

  • בנצ'מרק של מנועי הסקה

    השוואת ביצועים וזמני השהיה תחת תנאי קונקרנסי משתנים ורמות אנטרופיה שונות.

איפה זה נופל

חלק משמעותי מהטקסטים מוסתר בקובצי ההורדה הישירים ומחייב הרצת סקריפטים חיצוניים, מה שמסבך את תהליך הטעינה הראשוני. מבחינת שפות, המאגר מתמקד בעיקר באנגלית, וקטגוריית התרגום כוללת אמנם 23 שפות אך עברית אינה מופיעה בהן. בנוסף, חלוקת התפוקה מתבססת על ריפוד וחיתוך מלאכותיים לאורכים מוגדרים מראש, מבנה שלא תמיד משקף במדויק את התפלגות השאילתות במוצרים חיים בעולם האמיתי.

שאלות
נפוצות

האם הדאטהסט מתאים לעבודה בעברית?

הבנצ'מרק אינו מכיל עברית. קטגוריית השפות כוללת 23 שפות שונות כמו גרמנית, צרפתית, ערבית ורוסית, לצד דגש כבד על טקסטים באנגלית. בדיקת ביצועי מודלים בשפה העברית תדרוש מכם יצירת דגימות ייעודיות מחוץ למאגר הזה.

למה חלק מהשורות בקובצי הנתונים ריקות או מוסתרות?

כדי לעמוד בתנאי הרישוי של מקורות המידע המקוריים, אנבידיה מספקת חלק מהדוגמאות רק כהפניה. בשורות אלו מופיע טקסט שמפנה לסקריפט ההכנה החיצוני בגיטהאב. עליכם להריץ את הסקריפט כדי שיוריד את הטקסטים המלאים ישירות מהפרויקטים המקוריים אל המכונה שלכם.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

השימוש העיקרי שמוגדר ברישיון של אנבידיה הוא הערכה ובדיקה. בנוסף, המאגר הוא אוסף של מקורות בעלי רישיונות שונים כמו MIT, Apache ו־CC BY, כך שחובה לבדוק את הרישיון של כל מקור בנפרד לפני שמשלבים נתונים בתהליך ייצור או אימון מודלים.

במה הוא שונה ממאגרי הערכה ישנים כמו SpecBench?

ספקבנץ' סבל ממספר דגימות נמוך מאוד של כעשרה פריטים בקטגוריה ומאורכי קלט קצרים של פחות ממאה טוקנים. המאגר הנוכחי מרחיב את הבדיקות ל־80 דגימות מגוונות סמנטית בכל קטגוריה ומוסיף חלוקה ייעודית לקלטים ארוכים של עד 32 אלף טוקנים.

איך טוענים

הנתונים מופצים בקובצי Parquet בנפח כולל של כ־95 מגה בייט. לא נדרש אישור גישה מיוחד כדי להוריד את המאגר עצמו, אבל חלק מהדוגמאות בפנים מצונזרות ומכילות הודעה שדורשת משיכה ישירה מהמקור. כדי לקבל את הדאטה המלא מריצים את הסקריפט ייעודי מתוך מאגר הגיטהאב של Nvidia Model Optimizer, שמושך את הטקסטים החסרים מהאתרים המקוריים. השדות החשובים בכל רשומה כוללים את turns שמכיל את רצף הפניות בשיחה, שיוך לקטגוריה, קישור למקור המקורי ומזהה הדוגמה.

from datasets import load_dataset

ds = load_dataset("nvidia/SPEED-Bench")

הרישיון

המאגר כפוף להסכם רישוי ייעודי להערכה של חברת Nvidia שנמצא בקובץ License.pdf, ואינו תחת רישיון קוד פתוח סטנדרטי. בנוסף, הנתונים מורכבים ממקורות שונים בעלי רישיונות מגוונים כמו MIT, Apache 2.0 ו־CC BY 4.0. האחריות לוודא התאמה של כל מקור לשימוש מסחרי חלה עליכם, והרישיון הכולל מוגדר עבור תהליכי מדידה והערכה ולא לאימון מודלים מסחריים.

הרישיון המלא ב־Hugging Face ↗