GPT
L

Llama-3.1-Tulu-3-8B

קוד פתוח

allenaillama3.12024-11-20

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסת כוונון מתקדמת של אלן AI ללמה 8B עם דגש על מתמטיקה ומעקב הוראות. מתאימה למי שמחפש מודל מקומי קל שמנצח את מודל הבסיס של מטא ברוב המבחנים.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 7,986הורדות בחודש

מה זה

אלן AI לקחו את המודל הבסיסי של מטא והעבירו אותו שרשרת אימון מלאה, החל מאימון על הוראות, דרך DPO ועד חיזוק עם תגמול מאומת. המטרה שלהם הייתה ליצור מתכון פתוח לגמרי שמראה איך סוחטים ביצועים ממודל קטן. לפי המדדים שלהם הוא עוקף את הגרסה הרשמית של מטא, Llama 3.1 8B Instruct, עם ממוצע כללי של 64.8 לעומת 62.2.

היתרון מורגש בעיקר במתמטיקה ובהבנת פקודות מורכבות. במבחן GSM8K הוא מגיע ל־87.6 לעומת 83.4 של מטא, וב־MATH הוא רושם 43.7 מול 42.5. גם במעקב אחרי הוראות מדויקות ב־IFEval הוא מוביל עם 82.4. יחד עם זאת, במבחני ידע כללי כמו MMLU המודל המקורי של מטא עדיין משיג תוצאה טובה יותר, 71.2 לעומת 68.2.

מתאים ל

  • פתרון בעיות מתמטיקה

    מציג תוצאות חזקות במיוחד למודל 8B במבחני GSM8K ו־MATH בזכות אימון החיזוק.

  • ציות לחוקי פורמט נוקשים

    מצטיין במבחן IFEval ויודע לעקוב אחרי אילוצים מורכבים במבנה הפלט.

  • מחקר על תהליכי פוסט-אימון

    הקוד, הנתונים והמתכונים פתוחים לגמרי ומאפשרים לנתח כל שלב בלמידה.

איפה זה נופל

המודל אומן בעיקר באנגלית, כך שאין מה לבנות עליו לעיבוד טקסט בעברית ללא בדיקה מעמיקה. נקודת תורפה נוספת היא קוד, שם הוא רושם 83.9 במבחן HumanEval, תוצאה נמוכה משמעותית מ־Qwen 2.5 7B שמגיע ל־93.1.

אלן AI גם מבהירים שההגנות של המודל מוגבלות מאוד ואין כאן מנגנוני סינון אקטיביים כמו ב־ChatGPT, מה שאומר שהוא עלול לפלוט תוכן בעייתי אם דוחפים אותו לשם.

אותה משפחה

Llama-3.1-Tulu-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מציין אנגלית בלבד. הוא עשוי לפלוט עברית מקוטעת בגלל מודל הבסיס של מטא, אבל הוא לא כוונן לשפה הזו.

במה הוא עדיף על Llama 3.1 8B הרגיל?

הוא משיג ציונים גבוהים יותר בחישובי מתמטיקה, במעקב מדויק אחרי הוראות ורושם ציון בטיחות של 85.5 לעומת 75.2 של מטא.

אפשר להשתמש בו ישירות מול לקוחות?

לא מומלץ בלי שכבת סינון נוספת, כי אין בו מנגנוני הגנה ובקרה בזמן אמת כמו במודלים מסחריים סגורים.

איך מריצים

המשקלים תופסים 15 ג'יגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 24 ג'יגה זיכרון כמו RTX 3090 או 4090 יריץ אותו בקלות. אפשר לטעון אותו ישירות דרך ספריית transformers או להרים שרת מקומי עם vLLM.

אם אתם מריצים עם vLLM, מומלץ להגביל בהגדרות את האורך ל־8192 טוקנים כדי לא לחנוק את הזיכרון, למרות שהארכיטקטורה תומכת תיאורטית בהקשר רחב בהרבה. אין כאן גרסאות מכווצות רשמיות של GGUF בחבילה, אז תצטרכו להמיר לבד או לפנות ל־API חיצוני אם אין לכם חומרה ייעודית זמינה.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/Llama-3.1-Tulu-3-8B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3.1 של מטא, והיוצרים מייעדים אותו בעיקר למחקר ולחינוך. בנוסף, בגלל שהאימון כלל מידע שנוצר על ידי מודלים אחרים, חלים עליו גם תנאי השימוש של Gemma ושל Qwen 2.5, מה שמסבך שילוב שלו במוצרים מסחריים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗