GPT
S

suzume-llama-3-8B-multilingual

קוד פתוח

lightblueother2024-04-23

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

התאמה רב לשונית ללאמה 3 שמצילה אותו מההרגל לענות באנגלית לכל פנייה. פתרון מתאים למי שחייב מודל שמונה מיליארד שמדבר גרמנית, צרפתית, רוסית או יפנית.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 29.9 GBמשקל הקבצים
  • 9,233הורדות בחודש

מה זה

לאמה 3 המקורי בגודל הזה עובד מצוין באנגלית, אבל נוטה לחזור אליה גם כששואלים אותו בשפות אחרות. המפתח לקח את מודל ההוראות של מטא ואימן אותו על כמעט תשעים אלף שיחות רב לשוניות, כולל שיחות שנוצרו מול מודלים מתקדמים ודאטה מתורגם ביפנית.

במדדי השוואה מול גרסאות שבעה מיליארד אחרות, הוא מציג ציונים טובים יותר בגרמנית, צרפתית, יפנית וסינית, ונופל רק מעט מהמקור באנגלית עם ציון שבע נקודה שבעים ושלוש לעומת שבע נקודה תשעים ושמונה. ברוסית הוא מגיע לשמונה נקודה תשע עשרה, אם כי הבדיקה שם לא כללה מתמטיקה ותכנות בגלל מחסור בתשובות ייחוס. הרעיון כאן הוא פשוט לתקן את התנהגות השפה בלי לשבור את ההיגיון הכללי של המודל המקורי.

מתאים ל

  • בוט שיחה ביפנית או גרמנית

    הוא אומן במיוחד לשמור על השפה המבוקשת ולא ליפול חזרה לאנגלית באמצע השיחה.

  • תרגום וסיכום רב לשוני מקומי

    מאפשר לעבד טקסטים בשפות אירופיות ורוסית ישירות על חומרה מקומית ללא הוצאת נתונים לרשת.

  • הרצה מקומית על מחשב נייד

    בגרסת ה־GGUF אפשר להריץ אותו בכלים פשוטים ולקבל מודל שיחה סביר שלא מוגבל לאנגלית בלבד.

איפה זה נופל

אין בכרטיס שום אזכור לעברית, לא בנתוני האימון ולא בבדיקות הביצועים. אל תבנו עליו לעיבוד שפה מקומית לפני שבדקתם אותו בפועל, כי רוב הסיכויים שהוא ימשיך להגיב באנגלית או יפלוט טקסט משובש. המבחנים נבדקו רק מול שש שפות עיקריות, וברוסית הושמטו לגמרי שאלות של קוד והיגיון, כך שאין מידע איך הוא מתמודד עם משימות מורכבות בשפות שאינן אנגלית.

שאלות
נפוצות

האם המודל הזה עובד טוב בעברית?

אין שום עדות לכך בנתוני האימון או במבחנים שפורסמו. האימון התמקד בשפות כמו יפנית, גרמנית, צרפתית, רוסית וסינית, ולכן סביר להניח שהיכולת שלו בעברית חלשה מאוד או לא קיימת.

למה לא להשתמש פשוט בלאמה 3 המקורי של מטא?

המקור נוטה לענות באנגלית גם כשפונים אליו בשפות אחרות. אם אתם צריכים שהמודל יענה באופן עקבי בשפה שבה נשאל, הכוונון הזה פותר את הבעיה הזו בלי לאבד הרבה מהיכולות באנגלית.

איך מריצים

במשקל מלא של כמעט שלושים גיגה בייט בפורמט בי פלוט 16, תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון אותו ישירות דרך ספריות כמו vLLM. המפתח אימן אותו על ארבעה כרטיסי A100 תוך שעתיים וחצי, אבל להרצה בסיסית vLLM נותן את מהירות התגובה הטובה ביותר בקוד פייתון.

אם אתם מריצים מקומית על מחשב אישי, עדיף לחפש את גרסת ה־GGUF של הפרויקט ולהפעיל אותה בכלים כמו LM Studio. במקרה שאין לכם כרטיס ייעודי חזק וזמין, החזקה של שרת פעיל בשביל מודל שמונה מיליארד כזה תעלה יותר מפנייה ישירה ל־API מסחרי קיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="lightblue/suzume-llama-3-8B-multilingual")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא מצורף נוסח מלא בכרטיס. בגלל שמדובר בכוונון של לאמה 3, חלים עליו תנאי הרישיון המקוריים של מטא, הכוללים מגבלות מסוימות על שימוש מסחרי ואיסור שימוש בפלטים לאימון מודלים מתחרים. בלי בדיקה של תנאי הרישיון המדויקים, שילוב שלו במוצר מסחרי עלול לחשוף אתכם לסיכון משפטי.

הרישיון המלא בעמוד המודל ↗