GPT
L

Llama-3.1-Tulu-3-8B-SFT

קוד פתוח

allenaillama3.12024-11-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסת כוונון בסיסית של AI2 שמציגה שקיפות מלאה בדאטה ובקוד. אם אתם חוקרים שיטות אימון או רוצים בסיס נקי להמשך כוונון בלי התערבות של שלבי העדפה, היא נקודת מוצא טובה.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 20,666הורדות בחודש

מה זה

מדובר במודל שנוצר מאימון ישיר על הוראות מעל המודל הגולמי של מטא. בניגוד לגרסאות הסופיות בסדרה, כאן לא הופעלו אלגוריתמים של יישור העדפות כמו DPO או למידת חיזוק, אלא רק למידה מונחית על שילוב של נתונים סינתטיים ואנושיים. המטרה של המפתחים הייתה לייצר מתכון פתוח לחלוטין לכל שלבי הפוסט טריינינג.

במבחני הביצועים רואים בדיוק את המשמעות של מודל שנמצא באמצע התהליך. הוא מוביל במדדים מסוימים כמו בדיקות בטיחות עם ציון של 93.1 וציון של 67.9 ב־BigBenchHard, אבל במבחני שיחה חופשית ויכולת מעקב אחר הוראות מורכבות הוא מפגר בבירור. ב־AlpacaEval 2 הוא מקבל רק 12.4 לעומת מעל 33 בגרסאות ההמשך, וגם במתמטיקה הוא נשאר מאחור עם 31.5 במבחן MATH.

מתאים ל

  • אימון מודלי DPO עצמאיים

    הוא מהווה בסיס נקי שעבר אימון הוראות ומאפשר להחיל עליו ישירות שכבות העדפה ומשוב ייעודיות משלכם.

  • מחקר על תהליכי אימון

    כל נתוני האימון והקוד שלו פתוחים, מה שמאפשר לבודד את השפעת שלב הלמידה המונחית מול שלבי החיזוק.

  • הערכת ביצועי משימות לוגיות

    הוא מציג ציון של 67.9 ב־BigBenchHard, שמתעלה על מודלים מקבילים בגודל שמונה מיליארד פרמטרים.

איפה זה נופל

המודל הזה הוא תחנת ביניים ולא מוצר מוגמר לשיחה. הוא אינו כולל סינון תשובות בזמן אמת, ורמת השימושיות שלו בצ'אט נמוכה משמעותית מזו של מודלים שעברו אופטימיזציית העדפות. בנוסף, הוא מיועד בעיקר לאנגלית. אין בכרטיס שום תיעוד או התאמה לעברית, ולכן פניות בשפות אחרות צפויות להניב תוצאות חלשות ופחות יציבות.

אותה משפחה

Llama-3.1-Tulu-3 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה לבחור בגרסת SFT במקום בגרסה הרגילה של Tulu 3?

הגרסה הרגילה עברה שלבי אופטימיזציה נוספים של למידת חיזוק, ולכן היא עונה טוב יותר לבני אדם. גרסת ה־SFT מתאימה רק אם אתם חוקרים שרוצים לבחון את השלב המדויק הזה, או מפתחים שמעוניינים לבצע אלגוריתם יישור משלכם.

האם כדאי להשתמש בו ליישום בצ'אט בוט?

לא מומלץ. בבדיקות שיחה כמו AlpacaEval 2 הוא קיבל ציון נמוך של 12.4 אחוזים, והכרטיס מציין שאין לו שכבות סינון או תאימות לפרומפט מערכת מוגדר. עדיף להשתמש בגרסה שעברה כוונון מלא.

איך מריצים

כדי להריץ אותו במשקל המקורי של 15 גיגה בייט בפורמט bfloat16, צריך כרטיס מסך בודד עם 24 גיגה בייט זיכרון, כמו RTX 3090 או A10G. המודל עובד ישירות מתוך ספריית transformers או דרך שרתי vLLM, שם המפתחים ממליצים להגביל את אורך ההקשר ל־8192 טוקנים בהרצה מעשית כדי לחסוך זיכרון.

אם אתם צריכים רק לבדוק מענה נקודתי או לשלב אותו בבדיקות תוכנה קלות, מנוע אירוח חיצוני חוסך את עלויות הברזל. הרצה עצמית שווה את המאמץ בעיקר אם אתם מתכננים להמשיך ולאמן אותו מקומית על נתונים פנימיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/Llama-3.1-Tulu-3-8B-SFT")
print(pipe("שלום"))

הרישיון

הרישיון הוא Llama 3.1 Community License של מטא. מותר להשתמש בו לצרכים מחקריים ומסחריים, כל עוד המוצר שלכם לא עוקף את מגבלת 700 מיליון המשתמשים הפעילים בחודש של מטא. בנוסף, חל איסור להשתמש בפלטים שלו כדי לאמן מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗