GPT
H

Hermes-3-Llama-3.1-8B-GGUF

קוד פתוח

NousResearchllama32024-08-05

  • gguf
  • Llama-3
  • instruct
  • finetune
  • chatml

גרסת קוונטיזציה של מודל פתוח מבוסס Llama 3.1 שמתמקדת בהפעלת כלים וציות להנחיות. מתאים למי שרוצה סוכן מקומי שנשמע פחות מסורס ממודלי הבסיס של מטא.

  • 24.0 GBמשקל הקבצים
  • 27,455הורדות בחודש
  • 196לייקים

מה זה

מדובר בהתאמה של Llama 3.1 8B שהוכשרה על ידי NousResearch סביב פורמט ChatML, תוך דגש על שיחות מרובות שלבים, משחקי תפקידים, והחזרת פלט מובנה לפי סכמה. המטרה שלהם הייתה ליצור מודל שניתן לכיוון מדויק בלי הסירוס הרגיל שמטא דוחפת למודלים שלה, כך שהוא מקשיב להנחיות מערכת קיצוניות או מורכבות בלי להתווכח.

בגזרת היכולות, המודל אומן ספציפית על קריאות לפונקציות בפורמט מוגדר ועל יצירת JSON תקין. לפי המפתחים הביצועים שלו עומדים ראש בראש מול גרסת ה־Instruct הרשמית של Llama 3.1 בגודל 8B, עם יתרונות וחסרונות שמשתנים בין מבחנים שונים, כשהחוזק העיקרי כאן הוא האמינות בעבודה עם כלים וסוכנים.

מתאים ל

  • סוכנים מבוססי כלים

    המודל אומן לפלוט קריאות לפונקציות בפורמט מדויק, וממתין לתשובת המערכת כדי להמשיך.

  • חילוץ מידע למבנה JSON

    תמיכה בסכמות מוגדרות מראש דרך פרומפט המערכת כדי להבטיח קבלת אובייקט תקין בלבד.

  • משחקי תפקידים ושיחה

    ציות גבוה להנחיות מערכת שמגדירות אישיות, טון וחוקי שיחה עקביים לאורך זמן.

איפה זה נופל

המודל מוגדר רשמית רק לשפה האנגלית, כך שאין שום הבטחה או בדיקה לגבי עבודה בעברית. בנוסף, המפתחים מציינים בעצמם שיש לו נקודות חולשה מול Llama 3.1 המקורי במבחנים מסוימים. עבודה עם קריאות לפונקציות ופלט JSON דורשת שימוש קפדני בתבניות המערכת שהם הגדירו, ואם הקוד שלכם יסטה מהפורמט המדויק, המודל עלול לזייף בשדות או לפספס את תחביר הסגירה.

אותה משפחה

Hermes-3-Llama-3.1 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל מוגדר לשימוש באנגלית בלבד. יכול להיות שהוא יפלוט עברית בזכות משקלי הבסיס של מטא, אבל הוא לא עבר אופטימיזציה לשפה הזו ולא כדאי לבנות עליו למשימות בעברית.

במה הוא עדיף על Llama 3.1 הרשמי של מטא?

הוא פחות מסורס בהתנהגות שלו ומקבל הנחיות מערכת בצורה הרבה יותר גמישה. בנוסף, הוא עבר אימון ייעודי על יצירת קריאות לפונקציות ופלט JSON קשיח.

איך מריצים

הקבצים מגיעים בפורמט GGUF במשקל כולל של 24.0 ג'יגה בייט על פני שישה קבצים, והם מיועדים להרצה ישירה דרך llama.cpp. בשביל להריץ גרסאות מכווצות של מודל 8B מקומית תצטרכו כרטיס מסך עם לפחות שמונה עד עשרה ג'יגה בייט זיכרון כדי לעבוד במהירות סבירה, או מעבד חזק עם מספיק זיכרון מערכת.

אם אתם לא רוצים להתעסק עם ניהול זיכרון ומשאבים מקומיים, או שאתם צריכים לשרת מספר משתמשים במקביל, שווה להרים אותו מעל vLLM בענן או לפנות ל־API קיים. המודל דורש תבנית פרומפט מסוג ChatML, כך שאם התשתית שלכם כבר מדברת בפורמט של OpenAI, המעבר יהיה ישיר.

ollama run hf.co/NousResearch/Hermes-3-Llama-3.1-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 24.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון llama3 של מטא. זהו רישיון מסחרי מתירני לרוב השימושים והמוצרים, כל עוד אתם לא מגיעים להיקפי שימוש ענקיים של מאות מיליוני משתמשים חודשיים שמחייבים הסכם נפרד מול מטא, ועומדים במדיניות השימוש ההוגן שלהם.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗