GPT
H

Hermes-4.3-36B

קוד פתוח

NousResearchapache-2.02025-11-17

  • transformers
  • safetensors
  • seed_oss
  • text-generation
  • Bytedance Seed

מודל פתוח של 36 מיליארד פרמטרים שמציע חשיבה מובנית, תמיכה בכלים, ומסרב להרבה פחות בקשות ממודלים מסחריים סגורים.

  • 36Bפרמטרים
  • 524,288טוקנים בהקשר
  • 67.3 GBמשקל הקבצים
  • 3,702הורדות בחודש

מה זה

הגרסה הזו מבוססת על מודל הבסיס Seed 36B של ByteDance, ואומנה בצורה מבוזרת על גבי רשת Psyche עם מאגר של כשישים מיליארד טוקנים. היא מביאה מצב היברידי שבו המודל מחליט בעצמו מתי לפתוח בלוק של חשיבה שיטתית לפני התשובה הסופית, ומתי לענות מיד בלי לבזבז זמן ומשאבים. מעבר לכך, הוא מאומן ספציפית לפלוט JSON לפי סכמה, לתקן מבנים שבורים, ולהפעיל כלים חיצוניים בתוך השיחה.

הייחוד האמיתי שלו מול מודלים אחרים בקטגוריה הוא ההתנהגות שלו מול הנחיות משתמש. במבחן RefusalBench הוא ענה על 74.6% מהשאלות במצב רגיל ועל 72.29% במצב חשיבה, פער ניכר מול מודלים ענקיים שנוטים לסרב ולחסום שיחות. בצד הביצועים הקשיחים, במבחן המתמטיקה MATH-500 הוא מגיע לציון 93.8, ובמבחן AIME 24 הוא מקבל 71.9 נקודות, תוצאות שמתקרבות מאוד לגרסאות 70B.

מתאים ל

  • הפעלת כלים ו־JSON

    מאומן לפלוט JSON לפי סכמה מוגדרת, לתקן מבנים שבורים ולהריץ פונקציות ישירות מתוך בלוק החשיבה.

  • עוזר פיתוח וקוד

    ציונים גבוהים במבחני מתמטיקה ולוגיקה, לצד היכולת לפרט את שרשרת המחשבה לפני הפתרון.

  • בוט ללא צנזורה עודפת

    מציג שיעור סירוב נמוך משמעותית ממודלים סגורים, ומתאים לתרחישים שבהם מודלים אחרים חוסמים את הפרומפט.

איפה זה נופל

במבחן העובדות SimpleQA המודל מתרסק לציון של 6.0 בלבד, בזמן שמודל 70B הוותיק יותר באותה סדרה מגיע ל־17.9. זה אומר שבכל מה שקשור לשליפת עובדות יבשות וידע כללי מדויק, הוא נוטה להזיות ולא שווה להסתמך עליו בלי אימות מקורות או חיבור למאגר חיצוני. בנוסף, חלון ההקשר אמנם מוגדר ל־524,288 טוקנים, אבל ניצול של גדלים כאלה בפועל דורש זיכרון עצום שלא מתאים לרוב התשתיות המקומיות, והמודל אומן ותועד באנגלית בלבד בלי שום בדיקות לעברית.

אותה משפחה

Hermes-4.3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מפעילים את מצב החשיבה המעמיק?

אפשר להעביר את הדגל thinking=True בתבנית השיחה, או להגדיר בפרומפט המערכת שהמודל יכתוב את תהליך המחשבה בתוך תגיות think. המודל יפלוט את שיקול הדעת שלו בתגית נפרדת לפני שיעבור לתשובה הסופית.

האם המודל מתאים ליישומים בעברית?

הכרטיס מצהיר על תמיכה בשפה האנגלית בלבד, וכל המבחנים שפורסמו נערכו באנגלית. אם המוצר שלכם פונה לקהל ישראלי, תצטרכו לבדוק בעצמכם את איכות הפלט וההבנה בעברית לפני שילוב שלו.

איך מריצים

כדי להריץ אותו בדיוק המקורי של bfloat16 צריך להתמודד עם משקל של 67.3 גיגה בייט, מה שמחייב לפחות שני כרטיסי 80GB או שרת עם 48GB ומעלה בקוונטיזציה כבדה. הוא רץ ישירות דרך transformers עם תבנית Llama-3-Chat, אבל לפרודקשן תצטרכו להשתמש במנועים כמו vLLM או SGLang, שכבר כוללים מפענח מובנה לקריאות הכלים שלו.

אם אין לכם שרת ייעודי או שאתם לא רוצים להחזיק חומרה דולקת, קיימות גרסאות GGUF ב־4 עד 8 ביטים, או שאפשר לפנות ישירות ל־API דרך Nous Portal ו־Chutes.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-4.3-36B")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, שילוב בתוך מוצרים סגורים והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗