GPT
L

Llama-3-SauerkrautLM-8b-Instruct

קוד פתוח

VAGOsolutionsother2024-04-19

  • transformers
  • safetensors
  • llama
  • text-generation
  • two stage dpo

התאמה של לאמה 3 הקטן שמיועדת ספציפית לגרמנית. אם אתם צריכים שיחה או שליפת מידע מדויקת בגרמנית לצד אנגלית בלי להחזיק מודל ענק, זאת הסיבה לבדוק אותו.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 9,337הורדות בחודש

מה זה

המודל הזה לוקח את לאמה 3 של מטא בגודל 8 מיליארד פרמטרים ומאמן אותו מחדש בשני סבבי DPO על דאטה גרמני מסונן, פעם אחת על 70 אלף דוגמאות ופעם שנייה על 20 אלף. המטרה כאן ברורה: לשפר את ההבנה והתגובות בגרמנית בלי לשבור לגמרי את האנגלית.

במבחני הביצועים הוא מחזיק ממוצע של 74.57 ב־Open LLM Leaderboard, עם ציון HellaSwag של 89.60 וציון MMLU של 66.55. ב־MT-Bench הוא הוציא ציון של 7.65 בגרמנית ו־7.90 באנגלית, ירידה קלה באנגלית ביחס למקור של מטא בגלל ההתמקדות בהוראות בגרמנית. במבחן RAG בגרמנית הוא הגיע לדיוק כולל של 91 אחוז, מה שמראה שהוא מחזיק קשר טוב עם טקסט מקור בשפה הזו.

מתאים ל

  • עוזר שיחה בגרמנית

    אימון ה־DPO התמקד במתן מענה קולח ומותאם לשפה הגרמנית לפי תבנית ההנחיות המובנית.

  • מערכות RAG בגרמנית

    המודל השיג דיוק של מעל 90 אחוז במבחני שליפת מידע והתאמת שאלות להקשר בשפה הגרמנית.

  • יישומי קצה מכווצים

    זמינות גרסאות GGUF ו־EXL2 מאפשרת להריץ אותו ישירות על מחשבים אישיים בלי להחזיק שרת יקר.

איפה זה נופל

ההתמקדות בגרמנית גבתה מחיר, והיוצרים מציינים במפורש שהציון באנגלית ב־MT-Bench נמוך יותר מהמודל המקורי של מטא. עברית בכלל לא ברשימת השפות הנתמכות, כך שאל תצפו ממנו לתפקוד סביר בעברית. בנוסף, המפתחים מזהירים מראש שסינון המידע אינו מושלם ועלול להשתחרר פלט לא מצונזר או לא הולם.

שאלות
נפוצות

האם הוא מסוגל לעבוד בעברית?

המודל אומן והוגדר עבור גרמנית ואנגלית בלבד. עברית לא נכללה בנתוני האימון, ולכן הוא לא יתאים למשימות בעברית.

האם הוא טוב יותר מלאמה 3 המקורי באנגלית?

לא. המפתחים עצמם מראים שהציון שלו במבחן ה־MT-Bench באנגלית ירד ל־7.90 לעומת המודל הנקי של מטא, בגלל הדגש החזק על גרמנית.

איך מריצים

כדי להריץ את המודל המקורי בדיוק bfloat16 צריך כרטיס מסך עם לפחות 16 עד 20 ג'יגה־בייט זיכרון, שכן המשקלים עצמם שוקלים 15.0 ג'יגה־בייט. פריסה כזו דורשת חומרה כמו RTX 3090, RTX 4090 או מאיצים ייעודיים בענן.

מי שאין לו כרטיס כזה יכול להשתמש בגרסאות מכווצות של GGUF או EXL2 שהקהילה הכינה עבורו, שמאפשרות לרוץ על מעבדים ביתיים או כרטיסים צנועים יותר. אם אין לכם תשתית יציבה או צורך בפרטיות מחמירה, שווה לשקול פתרונות ענן מוכנים במקום לתחזק שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="VAGOsolutions/Llama-3-SauerkrautLM-8b-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת תנאי הרישיון של מטא ללאמה 3, למרות שבמטאדטה נרשם other. הוא מתיר שימוש מסחרי ומחקרי בהתאם למגבלות המקוריות של מטא, אבל המפתחים מדגישים שהם אינם מספקים ייעוץ משפטי ולא לוקחים אחריות על שימושי צד שלישי.

הרישיון המלא בעמוד המודל ↗