GPT
H

Hermes-2-Theta-Llama-3-8B

קוד פתוח

NousResearchapache-2.02024-05-05

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3

שילוב בין Llama 3 Instruct לבין Hermes 2 Pro שנועד להוציא תשובות בפורמט JSON מדויק ולהפעיל פונקציות. הוא מביא יכולות של מודלי שיחה מתקדמים לקוד מקומי בלי לשלם לפי טוקן.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 10,377הורדות בחודש

מה זה

מדובר במודל שנוצר ממיזוג של שני מודלים קיימים ואימון RLHF נוסף שביצעו בצוותי Nous Research ו־Arcee. הבסיס הוא Llama 3 בגודל שמונה מיליארד פרמטרים, אבל המטרה העיקרית פה היא התנהגות מובנית. הוא עובד בפורמט ChatML שמוכר מ־OpenAI, ומאומן להחזיר אובייקטים לפי סכמה מוגדרת מראש או לייצר קריאות לפונקציות חיצוניות.

במבחני ביצועים הוא מציג ממוצע של 72.59 בבנצ'מרק של GPT4All, וציון של 8.19 ב־MT_Bench, שבודק שיחה רב שלבית. במבחן IFEval שבודק ציות להוראות ספציפיות הוא עומד על 72.64, בעוד שבמבחני הבנה וידע כללי מורכבים כמו AGIEval ו־BigBench הוא מקבל סביב 44 נקודות. המשמעות בפועל ברורה: הוא ממושמע מאוד למבנה, לתפקידים ולפורמטים, אבל חלש יותר בהסקה מעמיקה או במענה על שאלות ידע קשות.

מתאים ל

  • סוכני קוד והפעלת כלים

    הוא מאומן להוציא קריאות לכלים עם ארגומנטים מדויקים מתוך פונקציות פייתון.

  • חילוץ מידע ל־JSON

    היענות טובה לסכמות מוגדרות שמונעת שבירה של תהליכי עיבוד נתונים אוטומטיים.

  • בוט שיחה במחשב מקומי

    יכולת לעבוד עם ChatML ודרישות חומרה של 5 גיגהבייט בגרסה מקוונטטת.

איפה זה נופל

הכרטיס מגדיר אותו כניסיוני. המודל מוגדר רשמית לדוברי אנגלית בלבד, ואין עליו שום בדיקות או התאמה לעברית, כך שלא הייתי בונה עליו לשפה מקומית. בנוסף, חלון ההקשר מוגבל ל־8,192 טוקנים, שזה מעט מאוד לעבודה מול מסמכים ארוכים או מערכות סוכן שמחזיקות היסטוריית שיחה עמוסה.

אותה משפחה

Hermes-2-Theta-Llama-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לעבוד בעברית בצורה אמינה?

המודל סומן רשמית לשפה האנגלית בלבד. יכול להיות שהוא יפלוט משפטים בעברית בגלל הדאטה של Llama 3, אבל הוא לא אומן ולא נבדק על שום משימה בעברית, ולכן לא מתאים לממשקים בעברית.

איך מחברים אותו לקריאות לפונקציות שלי?

מגדירים את חתימת הפונקציה בתוך ה־System Prompt לפי הפורמט של NousResearch. המודל מחזיר תגית ייעודית עם שם הפונקציה והארגומנטים, אתם מריצים אותה בקוד שלכם, ומחזירים לו את התשובה כהודעה עם תפקיד Tool.

איך מריצים

כדי להריץ את משקלי ה־bfloat16 המקוריים, ששוקלים כ־15 גיגהבייט, צריך כרטיס מסך עם לפחות 16 עד 24 גיגהבייט זיכרון גרפי. מי שרוצה פתרון קל וזול יותר יכול לפנות לגרסת קוונטיזציה של 4 ביט שמורידה את הדרישה לסביבות 5 גיגהבייט זיכרון, מה שמאפשר להריץ אותו גם על מחשב נייד חזק או כרטיס גיימינג פשוט.

ההרצה בקוד נעשית באמצעות ספריית transformers או דרך תוכנות כמו LM Studio אם עובדים עם קובצי GGUF, רק שצריך לזכור ששם אין תמיכה מובנית בחיוג פונקציות. אם אין לכם חומרה ייעודית שרצה ברציפות, או שאתם לא חייבים פרטיות מוחלטת למידע, כנראה יהיה זול ומהיר יותר לשלוח קריאות לשירות ענן שמארח אותו לפי שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-2-Theta-Llama-3-8B")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗