GPT
H

Hermes-2-Theta-Llama-3-8B-GGUF

קוד פתוח

NousResearchרישיון לא דווח2024-05-13

  • gguf
  • Llama-3
  • instruct
  • finetune
  • chatml

שילוב נסיוני בין Hermes 2 Pro לבין Llama-3 8B Instruct שנועד להוציא מבנה JSON מדויק ולהפעיל פונקציות. הוא מתאים למי שבונה סוכנים מקומיים ורוצה תאימות לפרומפטים של OpenAI.

  • 39.0 GBמשקל הקבצים
  • 3,516הורדות בחודש
  • 93לייקים

מה זה

מדובר במיזוג מודלים שנוצר בעזרת MergeKit יחד עם Arcee, שעבר אימון RLHF נוסף כדי לחבר את יכולות השיחה של Llama 3 עם המומחיות של סדרת Hermes. הוא עובד עם פורמט ChatML מלא, מה שמקל על הגדרת תפקידי מערכת ושמירה על חוקים נוקשים לאורך שיחה מתמשכת.

החוזק העיקרי כאן הוא דיוק במבנה. המודל אומן ספציפית להחזיר רק אובייקטי JSON מוגדרים לפי סכמה, או לייצר תגיות ייעודיות לקריאה לפונקציות חיצוניות. במבחני ביצועים הוא מציג ממוצע של 72.59 ב־GPT4All וציון של 8.19 ב־MT_Bench, שמעידים על יכולת מענה טובה בשיחות רב-שלביות, לצד 72.64 ב־IFEval שמודד עמידה מדויקת בהוראות מורכבות.

מתאים ל

  • הפעלת פונקציות מקומית

    חילוץ פרמטרים וקריאה לכלים חיצוניים בתוך קוד פייתון לפי תבנית מוגדרת.

  • פליטת JSON לפי סכמה

    המרת טקסט חופשי למבנה נתונים קשיח בלי תוספות מלל מיותרות.

  • סוכני שיחה מותאמים

    שליטה בסגנון ובהתנהגות המודל דרך פרומפט מערכת מורכב בפורמט ChatML.

איפה זה נופל

במבחנים שמודדים ידע מורכב והיגיון עמוק כמו AGIEval ו־BigBench הוא מגרד את ה־44 אחוז בלבד, מה שאומר שהוא עדיין מוגבל ביכולות החשיבה של מודל 8B ולא יחליף מודלי ענק במשימות מחקר. המודל מוגדר רשמית לאנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד עברית, וממשק LM Studio הרגיל אינו תומך בהפעלת הפונקציות שלו ללא קוד חיצוני ייעודי.

אותה משפחה

Hermes-2-Theta-Llama-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

הכרטיס מציין תמיכה בשפה האנגלית בלבד. מודלי הבסיס מסוגלים לעיתים להבין עברית בסיסית, אך לא מומלץ להסתמך עליו למשימות בעברית או לחילוץ נתונים מדויק בשפה זו.

איך מחברים אותו לקריאות לפונקציות בפועל?

תוכנות כמו LM Studio לא תומכות במנגנון הזה ישירות. צריך להשתמש בקוד הפייתון שהמפתחים פרסמו בריפו Hermes-Function-Calling, שמפרסר את תגיות ה־tool_call ומחזיר את תשובת ה־API כהודעת מערכת.

איך מריצים

בגרסת 4 ביט המודל צורך סביב 5GB של זיכרון כרטיס מסך, כך שאפשר להריץ אותו בקלות על חומרה ביתית סבירה או מחשב נייד עם GPU ייעודי. סך כל הקבצים במאגר שוקל 39.0GB ומחולק לשבעה קבצים, מה שמאפשר לבחור את רמת הקוונטיזציה שמתאימה למגבלות הזיכרון שלכם.

אפשר לטעון אותו ישירות בכלים מבוססי llama.cpp כמו LM Studio, שנותנים ממשק גרפי מוכן עם תמיכה מובנית ב־ChatML. אם המטרה היא שימוש יומיומי בפונקציות וב־JSON, עדיף להריץ את קוד הפייתון הייעודי של המפתחים, כי ממשקים גרפיים פשוטים לרוב לא יודעים לפרק את תגיות הכלים ולהחזיר את התוצאה למודל.

ollama run hf.co/NousResearch/Hermes-2-Theta-Llama-3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור שימוש ברור, וכל שילוב שלו במוצר מסחרי או הפצה ללקוחות חושפים אתכם לסיכון משפטי עד שהיוצרים יבהירו את תנאי ההפצה.

הרישיון המלא בעמוד המודל ↗