GPT
H

Hermes-4-70B-FP8

קוד פתוח

NousResearchllama32025-08-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3.1

גרסת קוונטיזציה של מודל קוד פתוח חזק, שמשלבת חשיבה שיטתית וסירוב מינימלי לבקשות. היא מיועדת למי שרוצה ביצועים של מודל ענק עם שליטה מלאה בשרת.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 67.7 GBמשקל הקבצים
  • 1,494הורדות בחודש

מה זה

מדובר בהתאמה של Llama 3.1 בגודל 70 מיליארד פרמטרים, שעברה אימון המשך על כשישים מיליארד טוקנים. השינוי המרכזי כאן הוא מצב חשיבה היברידי שבו המודל כותב תהליך מחשבה לפני התשובה, לצד דגש חזק על קריאה לפונקציות ופליטת מבני מידע תקינים לפי דרישה.

הצוות שפיתח אותו שם דגש על צמצום סירובים, והמודל עוקף מודלים מסחריים סגורים במבחן ייעודי של נכונות לענות על שאלות מורכבות בלי להטיף מוסר. הוא מתאים למשימות תכנות, מתמטיקה ומדעים, ויודע לתקן מבני נתונים פגומים תוך כדי ריצה.

מתאים ל

  • הפעלת סוכנים וכלים

    הוא קורא לפונקציות בתוך תהליך החשיבה ומייצר פלט מתאים להמשך ריצה.

  • יצירת מבני JSON

    המודל אומן במיוחד להיצמד לסכמות מוגדרות ולתקן מבנים שבורים.

  • משימות לוגיקה ותכנות

    מצב החשיבה המובנה משפר משמעותית פתרון בעיות קוד ומתמטיקה מורכבות.

איפה זה נופל

המודל אומן בעיקר באנגלית, ולכן ביצועים בשפות אחרות לא מובטחים ודורשים בדיקה זהירה. בנוסף, מנגנון החשיבה הארוך מייצר טוקנים רבים לפני התשובה הסופית, מה שמאט את קצב המענה ומנפח את השימוש במשאבים אם לא מגבילים אותו מראש בהגדרות.

אותה משפחה

Hermes-4 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מפעילים את מצב החשיבה המעמיק?

מגדירים את הדגל הייעודי בתבנית השיחה או מוסיפים הוראת מערכת שמבקשת ממנו לחשוב. המודל יפלוט את תהליך המחשבה בתוך תגיות מיוחדות לפני שיכתוב את המענה הסופי.

האם אפשר להריץ אותו על כרטיס גרפי ביתי יחיד?

לא, קובצי המודל תופסים קרוב לשבעים גיגה בייט בזיכרון, ולכן כרטיס בודד רגיל לא יספיק. לשימוש מקומי צריך חומרת שרת מתאימה או גרסה מכווצת יותר כמו קובצי GGUF.

איך מריצים

המשקל הכולל של הקבצים מגיע לשישים ושבעה נקודה שבע גיגה בייט, כך שצריך לפחות שני כרטיסי שרת עם זיכרון כולל של מעל שמונים גיגה כדי להחזיק את המודל ואת חלון ההקשר. המנועים המומלצים לעבודה איתו הם vLLM או SGLang, שכבר כוללים מפענחי כלים מובנים לפורמט שלו.

אם אין לכם שרת ייעודי כזה פנוי, עדיף להשתמש בספקי ענן כמו Chutes או Nebius שכבר מציעים אותו דרך ממשק פשוט, במקום להסתבך עם תחזוקת חומרה יקרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-4-70B-FP8")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של מטא עבור Llama 3.1. מותר להשתמש בו לצרכים מסחריים ומחקר חופשי, כל עוד המוצר שלכם משרת פחות משבע מאות מיליון משתמשים פעילים בחודש ואינו מפר את מגבלות השימוש ההוגן של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗