GPT
L

Llama-3.1-Tulu-3-405B

קוד פתוח

allenaillama3.12025-01-09

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

גרסת כוונון פתוחה של אלן AI על בסיס לאמה הענק, שמיועדת למחקר ומציגה מתכון אימון שקוף לגמרי. היא מנצחת את המודל המקורי של מטא בחלק ממבחני ההיגיון והקוד.

  • 406Bפרמטרים
  • 131,072טוקנים בהקשר
  • 1.5 TBמשקל הקבצים
  • 295הורדות בחודש

מה זה

מדובר במודל הדגל בסדרת טולו 3, שעבר תהליך פוסט אימון מלא שכולל כוונון מונחה הוראות, אופטימיזציית העדפות ישירה וחיזוק באמצעות למידת חיזוק עם אימות. המטרה של אלן AI היתה לייצר משקלים פתוחים שאינם מסתירים את הדאטה והקוד ששימשו לבנייתם, בניגוד לרוב המודלים המסחריים.

במדדי ביצועים הוא עוקף את המקור של מטא, Llama 3.1 405B Instruct, עם ממוצע של שמונים נקודות לעומת 78.1. במבחן GSM8K לחשיבה כמותית הוא מגיע ל־95.5 אחוז, וב־AlpacaEval הוא רושם ניצחון של 51.4 אחוז מול 38.5 של מטא. הוא מתקרב לביצועים של GPT 4o ושל Deepseek V3, אם כי במתמטיקה מורכבת כמו מבחן MATH הוא עדיין מפגר אחריהם.

מתאים ל

  • מחקר על תהליכי אימון

    כל הקוד, המתכונים והנתונים חשופים, מה שמאפשר לבדוק בדיוק איך שלבי יישור משפיעים על מודל ענק.

  • ייצור נתוני אימון סינתטיים

    היכולות הגבוהות בקוד ובמתמטיקה מאפשרות להשתמש בו כמנוע ליצירת דאטה עבור מודלים קטנים יותר.

  • פתרון בעיות היגיון מורכבות

    הוא מציג תוצאות גבוהות במיוחד במבחני חשיבה רב שלביים כמו GSM8K ו־BigBenchHard.

איפה זה נופל

המודל אומן בעיקר באנגלית, כך שאין לצפות לביצועים סבירים בעברית. אלן AI מציינים במפורש שההגנות של המודל מוגבלות ואין בו מנגנוני סינון בזמן אמת כמו אצל המתחרים המסחריים, מה שאומר שהוא עלול לפלוט תוכן בעייתי אם דוחפים אותו לשם. בנוסף, במבחן IFEval למעקב מדויק אחרי הוראות הוא קיבל ציון 86, שזה נמוך יותר מגרסת ההוראות המקורית של מטא.

אותה משפחה

Llama-3.1-Tulu-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על שרת ענן סטנדרטי עם כרטיס יחיד?

לא. המודל שוקל טרה וחצי ודורש מערך של כמה שרתי GPU מרובי כרטיסים מהשורה הראשונה רק כדי להחזיק את הפרמטרים בזיכרון. למשימות שאינן דורשות את מלוא הכוח שלו, מומלץ לבדוק את גרסאות ה־8B או ה־70B של אותה סדרה.

האם כדאי להחליף את המודל של מטא בגרסה הזו?

אם אתם צריכים ביצועים עדיפים בהיגיון, פתרון בעיות ומתמטיקה, טולו 3 מציג מספרים עדיפים במבחנים האלה. מצד שני, אם אתם מסתמכים על מערכת בטוחה עם מינימום סיכון לפליטת תוכן בעייתי או זקוקים למעקב נוקשה אחרי פורמטים, המודל של מטא עבר בדיקות בטיחות מקיפות יותר.

איך מריצים

המשקלים שוקלים 1.5 טרה בייט ומחולקים ל־392 קבצים בפורמט bfloat16. להריץ מפלצת כזו מקומית דורש קלאסטר רציני של שרתי GPU עם מאות גיגה בייט של זיכרון גרפי ייעודי, בדרך כלל שמונה מעבדי H100 ומעלה, רק כדי לטעון אותו לזיכרון לפני שבכלל שלחתם פרומפט ראשון.

אפשר לטעון אותו דרך vLLM עם פקודת שרת פשוטה, אבל בגלל גודל המודל מומלץ להגביל את אורך ההקשר לשמונת אלפים טוקנים כדי לא לחנוק את החומרה. אם אין לכם גישה למחשב על ארגוני, אין שום היגיון לנסות להרים אותו לבד, ועדיף להשתמש ב־API מוכן או בגרסאות הקטנות יותר של הסדרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/Llama-3.1-Tulu-3-405B")
print(pipe("שלום"))

הקבצים

392 קבצים במאגר, 1.5 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל כפוף לרישיון הקהילתי של Llama 3.1 מבית מטא. בנוסף, בגלל שאימנו אותו על פלטים של מודלים אחרים, חלים עליו גם תנאי השימוש של Gemma והרישיון של Qwen 2.5, והיוצרים מציינים שהוא מיועד בעיקר למחקר ולחינוך.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗