GPT
H

Hermes-4-14B

קוד פתוח

NousResearchapache-2.02025-08-30

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • Qwen-3-14B

גרסת 14B מבוססת Qwen 3 שמשלבת חשיבה עמוקה והפעלת כלים. מי שבוחר בה מחפש מודל פתוח בלי סינונים מוגזמים ויכולת היצמדות מעולה לסכמות.

  • 424960פרמטרים
  • 40,960טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 3,566הורדות בחודש

מה זה

מדובר באימון המשך על בסיס Qwen 3 14B שנבנה כדי לפתור שתי בעיות שמציקות למפתחים: סירובים מיותרים ומבנה פלט שבור. הוא מאומן על קורפוס של כשישים מיליארד טוקנים, ומשלב מצב היברידי שבו הוא מייצר תגי חשיבה פנימיים לפני מתן התשובה. החוזק שלו ניכר בפתרון בעיות קוד, מתמטיקה, והפעלת פונקציות בתוך שיחה.

הייחוד המרכזי מול מודלים אחרים בגודל הזה הוא תוצאות מבחן RefusalBench שהיוצרים בנו. לפי הנתונים שלהם, הוא עוקף מודלים סגורים ופתוחים ביכולת לציית להוראות בלי לחנך את המשתמש או לסרב לפניות תקינות. בנוסף, הוא מאומן ספציפית לתקן מבני JSON מקולקלים ולייצר פלט תקין לפי הגדרות מראש.

מתאים ל

  • סוכני קוד והפעלת כלים

    אינטגרציה מובנית של קריאות פונקציה תוך שילוב תהליכי חשיבה לתכנון מדויק של פעולות.

  • חילוץ מידע ל־JSON

    אימון ייעודי להיצמדות לסכמות קשיחות ותיקון שגיאות תחביר של אובייקטים פגומים.

  • מערכות ללא סינון יתר

    שירותים שדורשים חופש פעולה רחב וציות מלא להנחיות המשתמש ללא חסימות תוכנה מיותרות.

איפה זה נופל

המודל הוגדר רשמית עבור השפה האנגלית בלבד. אם תנסו לעבוד איתו בעברית תגלו מהר מאוד שהביצועים צונחים והתחביר נשבר, כך שהוא לא מתאים לעיבוד שפה מקומי בלי אימון נוסף. בנוסף, מנגנון החשיבה העמוקה גורר זמני תגובה ארוכים יותר וצריכת טוקנים מוגברת, מה שעלול לייקר שיחות פשוטות שלא דורשות מחשבה מעמיקה.

אותה משפחה

Hermes-4 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית לשימוש במוצרים בישראל?

לא מומלץ לבנות עליו לפרויקטים בעברית. המודל מוגדר רשמית לשפה האנגלית בלבד, ואמנם ארכיטקטורת הבסיס מכירה מעט מילים בשפות אחרות, השליטה שלו והדיוק ייפגעו קשות.

איך מפעילים את מנגנון החשיבה העמוקה?

אפשר להפעיל את המצב הזה ישירות בתבנית השיחה באמצעות הדגל thinking=True, או להוסיף להנחיית המערכת הוראה לפלוט מחשבות פנימיות בתוך תגי think.

מה נדרש כדי לחבר אותו ל־vLLM עם קריאות לכלים?

המערכת תומכת בזה ישירות. כל מה שצריך זה להגדיר את מפענח הכלים של vLLM לסוג hermes, והמערכת תדע לחלץ את האובייקטים מתוך תגי הכלים של המודל.

איך מריצים

המשקל המקורי של הקבצים מגיע ל־27.5 גיגה בייט בפורמט bfloat16. כדי לטעון אותו כמו שהוא תצטרכו כרטיס מקצועי עם לפחות 32 או 48 גיגה זיכרון גרפי, במיוחד אם תרצו לנצל את חלון ההקשר המלא של ארבעים אלף טוקנים. בספריות כמו vLLM או SGLang אפשר להריץ אותו עם תמיכה מובנית בפירוק כלי הקריאה שלו.

אם אין לכם חומרה ייעודית, אפשר לפנות לגרסאות מכווצות ב־FP8 או GGUF שחוסכות מקום, או פשוט לצרוך אותו כ־API דרך ספקים כמו Nebius, Chutes או השרתים של Nous Research עצמם כדי לחסוך תחזוקת תשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-4-14B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשלב אותו בתוך מוצרים, לשנות אותו או לארח אותו בכל צורה שתרצו. התנאי היחיד הוא לשמור על הודעות זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗