GPT
H

Hermes-4-70B

קוד פתוח

NousResearchllama32025-08-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3.1

גרסה מכווננת של לאמה עם 71 מיליארד פרמטרים שמשלבת חשיבה פנימית עמוקה, היצמדות למבני נתונים ואחוז סירובים נמוך במיוחד מול בקשות משתמש.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 8,385הורדות בחודש

מה זה

מדובר בהמשך ישיר לפיתוח של נואוס ריסרץ על בסיס לאמה 3.1 בגודל 70B, שעבר אימון על כשישים מיליארד טוקנים. השינוי המרכזי כאן לעומת גרסאות קודמות הוא מנגנון חשיבה היברידי שפולט בלוקים מוגדרים של הסקת מסקנות לפני התשובה הסופית. המודל שומר על יכולות שיחה רגילות אבל יודע לעצור, לחשוב בצורה שיטתית ולתקן את עצמו במשימות קוד, מתמטיקה ולוגיקה.

היתרון הבולט הוא השליטה בהתנהגות שלו. לפי מבחן רפיוזל־בנץ שהוצג בכרטיס, הוא כמעט לא מסרב להוראות, בניגוד למודלים סגורים או למודלי בסיס שמפעילים צנזורה מוגזמת. הוא הותאם במיוחד להחזרת ג'ייסון לפי סכמה, כולל יכולת מובנית לתקן מבנים שבורים, ותומך בהפעלת כלים ישירות בתוך רצף החשיבה.

מתאים ל

  • חילוץ מידע לסכמות ג'ייסון

    הוא אומן לתקן מבנים שבורים ולהיצמד במדויק להגדרות שדות בלי לסטות מהפורמט.

  • הפעלת סוכנים וכלים

    התמיכה המובנית בהפעלת פונקציות בתוך תהליך החשיבה מונעת קריאות שגויות לכלים חיצוניים.

  • פתרון בעיות לוגיקה וקוד

    מצב החשיבה המעמיק מייצר שרשרת הסקת מסקנות שמאתרת באגים ומנתחת בעיות צעד אחר צעד.

איפה זה נופל

הכרטיס מצהיר על אנגלית בלבד, כך שעבור משימות מורכבות בעברית תצטרכו לבדוק בעצמכם אם הוא שומר על עקביות או מתחיל להזות. מעבר לזה, אחוז הסירובים הנמוך אומר שהמודל יבצע כמעט כל הוראה שתתנו לו, בלי מעצורי בטיחות מחמירים. אם אתם חושפים אותו למשתמשי קצה בלי שכבת סינון משלכם, אתם לוקחים סיכון לפליטת תכנים בעייתיים.

אותה משפחה

Hermes-4 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים להשתמש במצב החשיבה הארוך בכל בקשה?

לא. מצב החשיבה מופעל לפי דגל בהגדרות או הוראה בפרומפט המערכת. אפשר להריץ אותו כמודל שיחה רגיל ומהיר כשלא נדרשת לוגיקה כבדה.

האם המודל יסרב לענות על שאלות בנושאים רגישים?

הוא עבר אימון ייעודי להקטנת סירובים ומאפשר גמישות רבה יותר ממודלים מסחריים אחרים. עדיין מומלץ לבחון את התשובות שלו לפני שילוב במערכת ציבורית.

איך מריצים

כדי להריץ 131 גיגה־בייט של משקלים ברמת דיוק מקורית דרושים לפחות שני כרטיסי A100 או H100 עם 80 גיגה זיכרון כל אחד. מי שרוצה להריץ אותו מקומית חייב להשתמש בגרסאות מכווצות כמו FP8 או קובצי GGUF, או להרים אותו במנועי הסקה כמו vLLM או SGLang עם חלוקה בין כרטיסים.

אם אין לכם שרת ייעודי כזה בחברה, עדיף לפנות ישירות לספקי ענן כמו נואוס פורטל, נביוס או שוטס. הרצה עצמית של מפלצת כזו משתלמת רק כשיש דרישות פרטיות נוקשות שאוסרות על הוצאת מידע לרשת חיצונית.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-4-70B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 3 של מטא. מותר להשתמש בו לצרכים מסחריים ומחקר, כל עוד אין לכם יותר משבע מאות מיליון משתמשים פעילים בחודש במוצר שמבוסס עליו, ובתנאי שאתם שומרים על תנאי השימוש המקוריים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗