GPT
H

Hermes-3-Llama-3.1-405B

קוד פתוח

NousResearchllama32024-08-13

  • transformers
  • safetensors
  • llama
  • text-generation
  • Llama-3

אימון מלא על בסיס לאמה הענק, שמכוון לתת שליטה עמוקה בהנחיות מערכת וקריאות לפונקציות. מיועד למי שחייב מודל פתוח ברמה הגבוהה ביותר ולא מוכן להסתפק בגרסה של מטא.

  • 406Bפרמטרים
  • 131,072טוקנים בהקשר
  • 756 GBמשקל הקבצים
  • 1,147הורדות בחודש

מה זה

מדובר בכיוונון מלא לכל 406 מיליארד הפרמטרים של לאמה 3.1, מהלך שנעשה על גבי מחשבי למבדה לאבס ומבוסס על פורמט ChatML המוכר מ־OpenAI. המפתחים התמקדו בהיענות מדויקת ל־System Prompts, שיחות מרובות שלבים והחזרת פלטים מובנים בפורמט JSON לפי סכמה מוגדרת מראש.

לפי המפתחים, הביצועים שלו תחרותיים ישירות מול גרסת ה־Instruct המקורית של מטא ומציגים עליונות בחלק מהמשימות הכלליות, אם כי לכל אחד מהם יש נקודות חוזק וחולשה שונות. הדגש כאן הוא על גמישות בעיצוב סגנון התגובה והתפקיד שהמודל מקבל על עצמו, לצד יכולת אמינה להפעלת כלים חיצוניים.

מתאים ל

  • סוכנים מורכבים

    חילוץ שדות מדויק והפעלת כלים חיצוניים לפי סכמת JSON מוגדרת מראש.

  • משחקי תפקידים

    היצמדות הדוקה להנחיות מערכת ארוכות ומענה לפי אישיות מוגדרת.

  • פיתוח עם ChatML

    אינטגרציה נוחה במערכות שכבר בנויות לתחביר השיחה של מודלי OpenAI.

איפה זה נופל

הכרטיס מודה במפורש שיש למודל נקודות חולשה ביחס לגרסת ה־Instruct של מטא, ולא בכל מדד הוא מנצח. בנוסף, הוא מתועד באנגלית בלבד וללא נתונים על עברית, כך שיכולות השפה המקומית צפויות להיות מוגבלות. הריצה שלו דורשת שימוש קפדני בתבניות טקסט ייעודיות לקריאות פונקציה וסכמות, ואם הקוד שלכם לא יאכוף את הפורמטים האלה בצורה מדויקת, הוא עלול לייצר שגיאות פענוח.

אותה משפחה

Hermes-3-Llama-3.1 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על שרת מקומי בודד?

לא במצבו הרגיל. המודל שוקל 756 גיגה ודורש מעל 800 גיגה זיכרון וידאו, מה שמחייב שרת עם מספר כרטיסי עיבוד מתקדמים. גם עם גרסת FP8 המכווצת תצטרכו כ־430 גיגה זיכרון גרפי.

האם הוא מציג שיפור משמעותי מול הגרסה הרשמית של מטא?

הוא מתמחה בהיענות מדויקת יותר להנחיות מערכת וקריאות פונקציה, אבל המפתחים מבהירים שיש תחומים שבהם גרסת המקור של מטא עדיין עדיפה. כדאי לבחון אותו מול המשימות הספציפיות שלכם לפני החלפה.

איך מריצים

כדי להריץ את הגרסה המקורית ב־bfloat16 תצטרכו מעל 800 גיגה של זיכרון גרפי, כלומר קלאסטר ייעודי של כמה כרטיסי שרת חזקים שמסוגלים להחזיק 756 גיגה של משקלים. המפתחים עצמם מציינים חלופה מכווצת ב־FP8 שצורכת כ־430 גיגה זיכרון גרפי ומתאימה ל־vLLM, או שימוש ב־bitsandbytes ל־4 ו־8 ביט, אם כי הם מזהירים שזה איטי.

אלא אם יש לכם תשתית ענן ארגונית ייעודית ותקציב חומרה כבד, להריץ משקל כזה עצמאית זה פרויקט תחזוקה יקר ומסורבל. לרוב המפתחים עדיף לצרוך אותו דרך ספק צד שלישי שחושף אותו ב־API מאשר לקנות ולנהל אשכול שרתים כזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-3-Llama-3.1-405B")
print(pipe("שלום"))

הקבצים

199 קבצים במאגר, 756 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון לאמה 3 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אך כפוף למגבלות המקוריות של מטא, כולל תנאי שימוש מקובלים וחובת רישוי מיוחדת אם המוצר שלכם מגיע למאות מיליוני משתמשים פעילים בחודש.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗