GPT
H

Hermes-2-Pro-Llama-3-8B-GGUF

קוד פתוח

NousResearchapache-2.02024-05-01

  • gguf
  • Llama-3
  • instruct
  • finetune
  • chatml

גרסת GGUF של Llama 3 8B שעברה אימון ייעודי להפעלת פונקציות ופלט JSON מובנה. היא מתאימה למי שרוצה להריץ סוכן מקומי שיודע לדבר עם קוד חיצוני בלי שרת ענק.

  • 39.0 GBמשקל הקבצים
  • 2,354הורדות בחודש
  • 164לייקים

מה זה

מדובר בהתאמה של Llama 3 בקוטר 8 מיליארד פרמטרים, המבוססת על מאגר הנתונים המעודכן OpenHermes 2.5 לצד דאטהסט פנימי שפותח במיוחד עבור Function Calling ומבני JSON. המפתחים הוסיפו טוקנים ייעודיים כמו tools ו־tool_call כדי לאפשר שליפה ופירוק של קריאות תוך כדי הזרמת טקסט, ומבנה השיחה נשען על תקן ChatML המוכר מ־OpenAI.

במבחני הביצועים הפנימיים שלהם מול Fireworks.AI, הוא הגיע ל־90% הצלחה בהפעלת פונקציות ול־84% בדיוק של פלט JSON לפי סכמה. במבחנים כלליים כמו GPT4All הוא מחזיק ממוצע של 72.62, עם דיוק מנורמל של מעל 80% במשימות הבנה והיגיון כמו hellaswag ו־piqa, אך בציונים רחבים יותר כמו AGIEval ו־BigBench הוא נע סביב אזור ה־42 עד 43 נקודות, כך שכוחו המרכזי נשאר בהפעלת כלים מוגדרים היטב.

מתאים ל

  • סוכן מקומי לחיבור API

    מאומן לחלץ שמות פונקציות ופרמטרים מתוך שיחה עם 90% הצלחה במבחן ייעודי.

  • חילוץ מידע ל־JSON מובנה

    מייצר פלט שתואם סכמות מוגדרות מראש בלי סטיות טקסט מיותרות סביבו.

  • עוזר פיתוח וכתיבת סקריפטים

    נשען על בסיס Llama 3 8B ומסוגל לכתוב קוד עזר שמתחבר ישירות לספריות קיימות.

איפה זה נופל

הנתונים מראים נפילה ברורה במבחנים מורכבים הדורשים ידע מקצועי או חשיבה עמוקה, עם 42.44 ב־AGIEval ותוצאה חלשה במיוחד של 41% ב־TruthfulQA במדד mc1, מה שאומר שהוא עדיין מייצר הזיות בקלות. בנוסף, הוא מתועד ומאומן באנגלית בלבד. אם תפנו אליו בעברית כדי לחלץ נתונים או לייצר JSON, הדיוק יירד והתחביר עלול להישבר. כמו כן, כדי לקבל פלט במבנה תקין חייבים להזין תבנית מערכת קשיחה מאוד עם סכמת Pydantic מוכנה מראש.

אותה משפחה

Hermes-2-Pro-Llama-3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל בעברית?

המודל מוגדר רשמית עבור אנגלית בלבד. אף על פי ש־Llama 3 מבינה מעט עברית, האימון הייעודי של Hermes Pro על JSON ופונקציות לא כוון לעברית, ולכן ניסיון לעבוד איתו בשפה זו עלול לפגוע קשות באמינות הפלט.

איך מחברים אותו לקוד כדי שיריץ פונקציות?

צריך להשתמש בתבנית ChatML ולספק את חתימת הפונקציה בתוך הודעת המערכת, כפי שמודגם במאגר ה־GitHub של NousResearch. המודל מחזיר טוקן מיוחד של tool_call עם ארגומנטים בפורמט JSON, הקוד שלכם מריץ את הפעולה, ומחזיר לו את התשובה כהודעה עם תפקיד tool.

איך מריצים

ההפצה מגיעה בפורמט GGUF המיועד ל־llama.cpp, ולפי התיעוד הרצה בכימות של 4 ביט דורשת בסביבות 5GB זיכרון וידאו (VRAM). מחשב פיתוח מודרני עם כרטיס גרפי סביר מריץ אותו מקומית בקלות, ואפשר לטעון אותו ישירות בממשקים גרפיים כמו LM Studio לשיחה פשוטה.

אם אתם צריכים את יכולות ה־Function Calling בפועל, LM Studio לא תומך בזה מהקופסה ותצטרכו לקחת את קוד הפייתון והסכמות ממאגר ה־GitHub של הפרויקט. שבעת הקבצים במאגר שוקלים יחד 39.0GB ומכילים רמות שונות של דיוק, כך שאתם בוחרים קובץ אחד שמתאים לנפח הזיכרון שלכם במקום להוריד הכל.

ollama run hf.co/NousResearch/Hermes-2-Pro-Llama-3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית בתוך מוצרים. אין חובה לחשוף את הקוד שלכם, אך נדרש לשמר את הודעות זכויות היוצרים ואת כתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗