GPT
H

Hermes-3-Llama-3.1-70B

קוד פתוח

NousResearchllama32024-07-29

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3

גרסת כוונון עמוקה של לאמה שמיועדת להפעלת סוכנים ומשחקי תפקידים. המודל מתמקד בשליטה חזקה של המשתמש ובציות לפרומפטים מורכבים.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 2,865הורדות בחודש

מה זה

המודל הזה לוקח את הבסיס של לאמה 3.1 בגודל שבעים מיליארד פרמטרים ומכוון אותו ספציפית לשיחות מרובות שלבים, הפעלת פונקציות ויצירת פלט מובנה לפי סכמה. הוא משתמש בפורמט צ'אט של ChatML, מה שמאפשר להגדיר הוראות מערכת קשיחות מאוד ולהתאים אותו בקלות לפרויקטים שנבנו מול ממשקים של OpenAI.

המפתחים כיוונו את המודל להתנהגות צייתנית יותר ביחס למקור של מטא, במיוחד במשחקי תפקידים ובמשימות סוכנים שדורשות שליפה מדויקת של כלים. לפי המבחנים שהמפתחים מציגים, היכולות הכלליות תחרותיות מאוד מול גרסאות ההוראות הרשמיות של לאמה, אם כי יש ביניהן נקודות חוזק וחולשה שמשתנות לפי סוג המשימה.

מתאים ל

  • סוכנים והפעלת פונקציות

    אימון ייעודי לפענוח קריאות כלים והחזרת תשובות על בסיס נתונים ממערכות חיצוניות.

  • פלט JSON לפי סכמה

    תמיכה מובנית בהגדרת סכמות דרך פרומפט מערכת כדי להוציא רק מידע מובנה ומדויק.

  • משחקי תפקידים ודיבייט

    שליטה הדוקה בסגנון ובחוקי השיחה בעזרת פרומפט מערכת שלא נשבר בקלות.

איפה זה נופל

המודל מסומן רשמית עבור אנגלית בלבד. מי שבונה עליו לעברית יצטרך לבדוק אותו ביסודיות, כי הוא לא אומן ייעודית לשפה ועלול להמציא מילים או לקרוס בניסוח. בנוסף, המפתחים מציינים שיש הבדלים וחולשות מול מודל ההוראות הרשמי של מטא, כך שהוא לא עוקף אותו בכל תרחיש, וחובה לבחון את הדיוק שלו על המשימה הספציפית שלכם לפני העברה לסביבת ייצור.

אותה משפחה

Hermes-3-Llama-3.1 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לפרויקטים בעברית?

המודל מאומן ומתועד באנגלית בלבד. למרות שלאמה 3.1 יודעת לעבד עברית מסוימת, הכוונון של המודל לא נבדק על השפה ולכן לא מומלץ להסתמך עליו למשימות ניסוח או הבנה מורכבות בעברית בלי בדיקה מקדימה.

מה צריך כדי להריץ את הגרסה המקורית של המודל?

הקבצים שוקלים 131 גיגה בייט. בשביל הסקה מהירה ויציבה בפורמט המקורי תצטרכו שרת עם לפחות שני מאיצי 80GB VRAM, במיוחד אם תרצו לנצל את חלון ההקשר המלא של 131,072 טוקנים.

איך מריצים

במשקל מלא של 131 גיגה בייט בדיוק bfloat16, המודל הזה דורש שרת עם לפחות שני כרטיסי A100 או H100 של 80 גיגה כדי לעבוד בצורה יציבה, במיוחד אם מנצלים את חלון ההקשר הארוך. אפשר להרים אותו ישירות עם vLLM בעזרת פקודת שרת פשוטה מול Hugging Face.

אם אין לכם חומרה כזאת בענן מקומי, המפתחים הוציאו גרסאות מכווצות בפורמט GGUF להרצה מקומית וגרסאות FP8 של NeuralMagic. למי שאין תקציב לשרת כבד שרץ מסביב לשעון, עדיף לפנות למודל דרך ספקי API חיצוניים שמאחסנים אותו.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-3-Llama-3.1-70B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 3 של מטא. הוא מאפשר שימוש מסחרי חופשי לרוב החברות, כל עוד מספר המשתמשים החודשיים הפעילים לא חוצה את רף שבע מאות המיליון. המוצר שלכם כפוף למדיניות השימוש ההוגן וההגבלות המשפטיות של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗