GPT
H

Hermes-3-Llama-3.1-70B-GGUF

קוד פתוח

NousResearchllama32024-08-06

  • gguf
  • Llama-3
  • instruct
  • finetune
  • chatml

גרסה מכווצת של מודל קוד פתוח מוביל שמיועדת להרצה עצמאית, עם דגש על ציות קפדני להוראות, הפעלת כלים ושיחות מורכבות. מתאים למי שרוצה שליטה מלאה בלי שרתים של חברות ענק.

  • 264 GBמשקל הקבצים
  • 2,035הורדות בחודש
  • 54לייקים

מה זה

המודל מבוסס על Llama 3.1 בגודל 70 מיליארד פרמטרים, אבל עבר אימון מקיף של Nous Research כדי לתת למשתמש שליטה מקסימלית על הסגנון, התפקיד וההתנהגות שלו. היוצרים שלו התמקדו בהפיכתו לסוכן עצמאי שמסוגל לנהל שיחות ארוכות בלי לאבד הקשר, לייצר קוד ולבצע פקודות מובנות לפי דרישה.

בניגוד למודלי בסיס רגילים, הדגש כאן הוא על פורמט ChatML ועל יכולת מוכחת להוציא JSON תקין ולהפעיל כלים חיצוניים. המפתחים מציגים ביצועים שמתחרים ראש בראש מול גרסת ה־Instruct המקורית של מטא, עם יתרונות וחסרונות ספציפיים בכל משימה, כשהיתרון הגדול שלו הוא גמישות מלאה דרך ה־system prompt בלי חסימות יתר.

מתאים ל

  • בניית סוכני אוטומציה

    הוא אומן ייעודית לפענוח פקודות, החזרת ארגומנטים מדויקים והפעלת פונקציות ברצף שיחה.

  • חילוץ מידע לסכמת JSON

    כולל תמיכה מובנית בהגדרת טיפוסים ומבנים קשיחים ישירות מתוך המערכת.

  • משחקי תפקידים ושיחות עומק

    ציות גבוה להגדרות אישיות מורכבות ב־system prompt ושמירה על רציפות לאורך זמן.

איפה זה נופל

המודל אומן והוגדר רשמית לשפה האנגלית בלבד, כך שלא הייתי בונה עליו ליישומים בעברית בלי בדיקה יסודית מראש של רמת הפלט והתחביר. מעבר לזה, המפתחים מודים בעצמם בבנצ'מרקים שלמודל יש חולשות וחוזקות יחסיות לעומת המודל המקורי של מטא, ולא בכל פרמטר הוא מנצח. הפעלת כלים ופלט מובנה דורשים שימוש במבנה פרומפט מדויק מאוד של ChatML, ואם תסטו ממנו תקבלו תוצאות שבורות.

אותה משפחה

Hermes-3-Llama-3.1 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש במודל הזה בעברית?

המודל מוגדר רשמית לשפה האנגלית. הוא אולי יבין מעט עברית בזכות משקלי הבסיס של Llama, אבל הוא לא מיועד לזה ועלול לייצר שגיאות או פלט קטוע.

איך מחברים אותו לקוד קיים?

הוא משתמש במבנה ChatML התואם לממשקי ה־API הנפוצים בתעשייה, כך שקל לשלב אותו בספריות כמו llama.cpp או שרתי vLLM קיימים.

איך מריצים

הגרסה הזו מגיעה בפורמט GGUF ומיועדת ל־llama.cpp, מה שמאפשר להריץ אותה גם על מעבדים וכרטיסים גרפיים ביתיים או חצי-מקצועיים. המשקל הכולל של הקבצים במאגר מגיע ל־264 גיגה-בייט שמחולקים לתשעה קבצים, כך שמדובר במודל כבד מאוד שדורש זיכרון RAM או VRAM נרחב בהתאם לקוונטיזציה שתבחרו.

אם אין לכם תחנת עבודה חזקה עם כרטיסי מסך מתאימים, זה פשוט יזחל. במצב כזה, עדיף להריץ את הגרסה המלאה על שרת ענן עם vLLM או לקחת שירות מנוהל שמחזיק את המודל במקום להשקיע בברזלים מקומיים.

ollama run hf.co/NousResearch/Hermes-3-Llama-3.1-70B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama3 של חברת מטא. הוא מאפשר שימוש מסחרי ומחקר, אבל כפוף לתנאי השימוש והמדיניות של מטא, כולל מגבלות על מספר משתמשים חודשיים פעילים אם המוצר הופך לענק. לפני שילוב במוצר מסחרי, כדאי לקרוא את תנאי הרישיון המקוריים של Llama 3.1.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗