GPT
H

Higgs-Llama-3-70B

קוד פתוח

bosonaiother2024-06-05

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסה מכווננת של לאמה 3 בגודל 70B, שנבנתה כדי להחזיק דמויות ולא לסטות מההוראות של ה־system prompt. מתאים למי שבונה משחקי תפקידים או בוטים עם אישיות קשיחה.

  • 71Bפרמטרים
  • 8,192טוקנים בהקשר
  • 263 GBמשקל הקבצים
  • 8,417הורדות בחודש

מה זה

מדובר באימון המשך על גבי Meta-Llama-3-70B שמטרתו לחזק היצמדות לתפקידים מוגדרים. המפתחים ב־bosonai ביצעו fine-tuning עם דאטה-סטים פנימיים של שיחה ומעקב אחרי פקודות, ואחריו אופטימיזציית העדפות בעזרת מתייגים אנושיים ומודלים פרטיים, עם דגש על כך שהמודל לא יישבר תחת ה־system prompt.

לפי המבחנים שמוצגים בעמוד, הוא עוקף את מודל הבסיס Llama-3-70B-Instruct ברוב המדדים. הוא מקבל 63.2 ב־MMLU-Pro מול 56.2 של המקור, ו־49.6 ב־Arena-Hard מול 41.1, תוך שמירה על ביצועים דומים במבחני היגיון כמו GPQA ו־DROP. המשמעות היא שהכוונון למשחקי תפקידים לא שבר את יכולות ההסקה הכלליות שלו, והוא עדיין מתנהג כמודל חכם מאוד ביחס לקטגוריית המשקל שלו.

מתאים ל

  • בוטים של משחקי תפקידים

    הוא אומן להישאר בתוך הדמות שהוגדרה לו ב־system prompt ולא להישבר גם כשהמשתמש מנסה להוציא אותו מאיזון.

  • עוזרי שירות עם טון ייעודי

    היכולת להיצמד להנחיות סגנון מחמירות מתאימה לשיחות לקוחות שדורשות קול מותגי עקבי מאוד.

  • משחקי מחשב ודמויות וירטואליות

    מתאים להנעת דמויות ללא שחקן (NPCs) בעלות אישיות מוגדרת שצריכות לנהל דיאלוג חופשי בלי לסטות מהעלילה.

איפה זה נופל

חלון ההקשר מוגבל ל־8,192 טוקנים בלבד. בשיחות ארוכות של משחקי תפקידים, ההיסטוריה תמלא את הזיכרון מהר מאוד ותאלץ אתכם לחתוך או לתמצת את השיחה כדי לא לאבד את ה־system prompt. בנוסף, מול מודלים קנייניים מובילים כמו GPT-4o שמשיג 72.6 ב־MMLU-Pro ו־79.5 ב־Arena-Hard, יש עדיין פער מורגש ביכולות ההבנה וההיגיון המורכב.

שאלות
נפוצות

למה הקבצים שוקלים 263 גיגה-בייט והאם חייבים להוריד הכל?

המשקלים שמורים בדיוק מלא של float32, שזה פי שניים ממה שנדרש להרצה רגילה. בקוד ההרצה עצמו טוענים אותו ב־bfloat16 שלוקח כ־140 גיגה-בייט של זיכרון וידאו, אך לצורך ההורדה הראשונית מהמאגר תיאלצו להוריד את מלוא הנפח, אלא אם תמצאו גרסה שכבר הומרה או כווצה מראש.

האם הוא מתאים לניתוח מסמכים ארוכים?

לא. חלון ההקשר עומד על 8,192 טוקנים, שזה קצר מאוד למשימות של עיבוד קבצים כבדים או ספרים שלמים. המודל הזה מתמקד בשיחות קצרות ומדויקות ולא בזיכרון עבודה ארוך.

איך מריצים

המשקל של הקבצים מגיע ל־263 גיגה-בייט בגלל שמירת המשקלים ב־float32, אבל קוד ההרצה הרשמי טוען אותו ב־bfloat16 דרך ספריית transformers. כדי להרים אותו מקומית צריך לפחות שני כרטיסי A100 או H100 בנפח 80 גיגה, או לחלופין לבצע קוונטיזציה ל־4 או 8 ביט כדי לדחוס אותו לחומרה צנועה יותר.

אם אין לכם אשכול GPU ייעודי שרץ כל הזמן, העלות של תחזוקת שרת כזה תהיה יקרה משמעותית משליחת קריאות ל־API של ספקים חיצוניים שמריצים מודלי 70B, אלא אם הפרטיות או השליטה המלאה במשקלים קריטיים לפרויקט.

from transformers import pipeline

pipe = pipeline("text-generation", model="bosonai/Higgs-Llama-3-70B")
print(pipe("שלום"))

הקבצים

73 קבצים במאגר, 263 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומבוסס על רישיון הקהילה של Meta עבור Llama 3. הוא מתיר שימוש מסחרי ומחקרי, אך כפוף למגבלות של מטא, כולל דרישה לרישיון מיוחד אם המוצר שלכם מגיע ליותר מ־700 מיליון משתמשים פעילים בחודש. יש לבדוק את קובץ הרישיון המדויק במאגר לפני הטמעה במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗