GPT
D

DeepHermes-3-Llama-3-8B-Preview

קוד פתוח

NousResearchllama32025-02-12

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3

גרסה שמחברת יכולת הסקה עמוקה ומצב שיחה רגיל תחת מודל שמונה מיליארד פרמטרים. המעבר ביניהם נקבע לפי שורת הוראה בודדת.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 1,144הורדות בחודש

מה זה

הבסיס כאן הוא מודל שמונה מיליארד פרמטרים שזוקק מנתוני DeepSeek R1 ומציע משהו שלא רואים בדרך כלל בגודל הזה, מעבר מובנה בין מצב מחשבה מעמיק למצב שיחה רגיל. המעבר מתבצע פשוט באמצעות פרומפט מערכת שגורם לו לחשוב בתוך תגיות ייעודיות לפני שהוא עונה. לצד זה, המפתחים הוסיפו לו יכולות קריאת פונקציות ופליטת מבני מידע מוגדרים מראש על בסיס פורמט השיחה של לאמה.

במצב הסקה פתוח, המודל משפר משמעותית את הביצועים בפתרון בעיות מתמטיות מורכבות על חשבון זמן תגובה וטוקנים. כשהמצב הזה כבוי, הוא עובד כמו מודל שיחה רגיל ומציג תוצאות דומות לגרסת ההוראות המקורית, כך שלא צריך להחזיק שני מודלים נפרדים לתרחישים שונים.

מתאים ל

  • פתרון בעיות מתמטיות

    חשיבה מובנית בתגיות מחשבה מייצרת דיוק משופר בניתוח בעיות מורכבות.

  • הפעלת סוכנים וכלים

    תמיכה מובנית בקריאת פונקציות מאפשרת שליפת נתונים ממערכות חיצוניות.

  • חילוץ מידע למבנה מוגדר

    שמירה על סכמת JSON מוגדרת לצורך העברת נתונים נקייה לקוד המשך.

איפה זה נופל

זהו שחרור מוקדם, והמפתחים מבהירים במפורש שייתכנו התנהגויות מוזרות ולא צפויות. בבעיות קשות המודל מסוגל לייצר שרשרת מחשבה של עד 13,000 טוקנים בתוך תגיות המחשבה, מה שמחייב להגדיל את מגבלת הטוקנים לפלט ועלול לנפח את עלויות החישוב וזמני ההמתנה לרמות לא מעשיות. בנוסף, המודל אומן ותועד באנגלית בלבד, כך שאין שום הבטחה לתמיכה סבירה בעברית או במשימות רב לשוניות.

אותה משפחה

DeepHermes-3-Llama-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מפעילים את מצב החשיבה המעמיק?

מעבירים בפרומפט המערכת הנחיה ייעודית שמורה לו להתנהג כאינטליגנציה שחושבת לעומק. המודל יכתוב את שרשרת השיקולים שלו בתוך תגיות ייעודיות לפני שיציג את התשובה הסופית.

למה התשובה נחתכת באמצע בבעיות מורכבות?

במצב הסקה המודל יכול להשקיע אלפי טוקנים במחשבה פנימית לפני הפלט. צריך להגדיל את ערך הטוקנים המקסימלי להפקה כדי שהתשובה לא תיעצר באמצע.

האם המודל מתאים לעבודה בעברית?

המפרט הרשמי מגדיר אנגלית כשפה הנתמכת היחידה. מומלץ לבדוק אותו היטב לפני שמשלבים אותו במשימות מקומיות בעברית.

איך מריצים

המשקל המלא שוקל 15 ג'יגה בייט בפורמט bfloat16, מה שדורש מאיץ גרפי עם זיכרון ייעודי מתאים כדי להחזיק את המודל ואת חלון ההקשר. המפתחים מציינים שקיימות גרסאות מכווצות בפורמט GGUF להרצה קלה יותר, ואפשר להרים אותו ישירות עם פקודת שרת בודדת בספריית vLLM כדי לקבל ממשק תואם לחלוטין לקריאות API רגילות.

אם מריצים משימות הסקה מורכבות שבהן שרשרת המחשבה ארוכה במיוחד, צריכת המשאבים קופצת והתשובה מתעכבת. במצבים שבהם אין חומרה מתאימה להחזיק את הנפח הזה, אפשר להירשם לרשימת ההמתנה לשירות המרוחק של המפתחים במקום להריץ עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/DeepHermes-3-Llama-3-8B-Preview")
print(pipe("שלום"))

הרישיון

הרישיון הוא llama3 של חברת מטא. הוא מאפשר שימוש מסחרי ומחקר, אך כפוף למגבלות המקוריות של מטא, כולל הגבלת משתמשים חודשיים גדולים במיוחד וחובת ציות למדיניות השימוש שלהם.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗