GPT
D

DeepHermes-3-Llama-3-8B-Preview-GGUF

קוד פתוח

NousResearchllama32025-02-13

  • gguf
  • Llama-3
  • instruct
  • finetune
  • chatml

גרסת קוויקוון קומפקטית שמשלבת חשיבה מעמיקה ומענה רגיל לפי פקודה. מתאים למי שרוצה מודל שמונה מיליארד פרמטרים עם יכולות היסק של מודלים גדולים בלי שרת ענק.

  • 38.6 GBמשקל הקבצים
  • 1,715הורדות בחודש
  • 89לייקים

מה זה

המודל הזה לוקח את הבסיס של לאמה ומזקק אליו יכולות היסק מתוך DeepSeek R1, כשהייחוד שלו הוא מעבר בין שני מצבי עבודה. בהנחיית מערכת רגילה הוא עונה ישירות ומהר, ובהנחיית מערכת ייעודית לחשיבה הוא מפעיל שרשרת מחשבה ארוכה שסגורה בתוך תגיות ייעודיות לפני שהוא פולט את התשובה הסופית.

בנוסף להיסק לוגי, הוא כולל אימון מובנה לקריאה לפונקציות ופלט של מבני JSON לפי סכמה מוגדרת מראש. במקום לפצל את המשימות למודלים שונים, מקבלים נקודת קצה אחת שיודעת להתנהג כמו סוכן אוטונומי, לפרסר קריאות כלים ולהחליט מתי לחשוב לעומק.

מתאים ל

  • פתרון בעיות היסק מורכבות

    מצב החשיבה הארוך מאפשר לו לפרק שאלות לוגיות קשות בתוך תגיות ייעודיות לפני ניסוח התשובה.

  • סוכנים מבוססי כלים

    הוא אומן במיוחד לפלוט קריאות לפונקציות בפורמט מובנה ולקבל בחזרה תוצאות מהשרת שלכם.

  • החזרת תשובות במבנה נתונים

    הוא יודע להיצמד לסכמת ג'ייסון שמוגדרת מראש בהנחיית המערכת ולפלוט אובייקטים נקיים בלבד.

איפה זה נופל

היוצרים מגדירים את השחרור הזה במפורש כגרסת תצוגה מקדימה מוקדמת, ומזהירים מראש שעלולים לצוץ באגים והתנהגויות מוזרות. בבעיות מורכבות תהליך החשיבה עלול לקחת עד שלושה עשר אלף תווים, מה שמחייב הגדלה דרסטית של מכסת הטוקנים לפלט, מנפח את זמני ההמתנה ויכול להקפיא תהליכים שלא ערוכים לזה. בנוסף, המודל אומן באנגלית בלבד ולכן לא הייתי בונה עליו לשימושים מורכבים בעברית.

אותה משפחה

DeepHermes-3-Llama-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מפעילים את מצב החשיבה המעמיקה?

צריך להגדיר בהנחיית המערכת טקסט ספציפי שמורה לו לתפקד כבינה חושבת ולהכניס את המונולוג הפנימי שלו לתוך תגיות ייעודיות. בלי ההנחיה המדויקת הזו, הוא יענה במצב רגיל וישיר.

למה התשובות נחתכות לי באמצע?

במצב חשיבה המודל מייצר לפעמים אלפי טוקנים של מחשבות פנימיות לפני שהוא מתחיל לכתוב את הפתרון. צריך להגדיר פרמטר טוקנים מקסימלי גבוה בהרבה מהרגיל, שיכול להגיע גם מעבר לשניים וחצי אלף.

איך מריצים

ההפצה הזו ארוזה בפורמט GGUF ומיועדת להרצה עם llama.cpp, מה שאומר שאפשר להריץ אותה בקלות גם על מעבדים גרפיים צרכניים ואפילו על מעבדי מחשב נייד חזקים עם זיכרון משותף. הקבצים שוקלים יחד שלושים ושמונה נקודה שש גיגה בייט ומחולקים לשבעה חלקים, כך שצריך לוודא שיש מספיק מקום פנוי בדיסק ובזיכרון כדי לטעון אותם.

אם אין לכם כוח לנהל את התשתית בעצמכם או להחזיק כרטיס גרפי מקומי, אפשר להריץ אותו עם vLLM בפקודת שרת אחת או להירשם לרשימת ההמתנה לשירות ה־API הישיר שהיוצרים שלו מציעים.

ollama run hf.co/NousResearch/DeepHermes-3-Llama-3-8B-Preview-GGUF:Q6

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון הקהילה של מטא עבור לאמה שלוש. מותר להשתמש בו לצרכים מסחריים ומחקריים, בתנאי שלא עוברים שבע מאות מיליון משתמשים פעילים בחודש ובתנאי שמצייתים למדיניות השימוש המקובלת של מטא. אם המוצר שלכם פונה לקהל רגיל ואינו שירות ענק, אין בעיה לשלב אותו.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗