GPT
L

Llama-VARCO-8B-Instruct

קוד פתוח

NCSOFTllama3.12024-09-12

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3.1

גרסה מכווננת של לאמה 3.1 שנבנתה מראש כדי לדבר ולחשוב בקוריאנית שוטפת. אם המוצר שלכם לא פונה לשוק הקוריאני, אין לכם סיבה אמיתית להוריד דווקא אותו.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 2,462הורדות בחודש

מה זה

חברת המשחקים NCSOFT לקחה את מודל הבסיס של מטא והעבירה אותו אימון המשך מקדים יחד עם כוונון עדין ואופטימיזציית העדפות, במטרה לחזק את השפה הקוריאנית לצד שמירה על אנגלית. על הנייר זה מודל שמונה מיליארד פרמטרים שמתמחה בהוראות, אבל הדגש כאן הוא שפה ותרבות ספציפיות.

במבחן LogicKor שמתמקד בקוריאנית, הוא קיבל ציון משוקלל של 8.82 לעומת 5.42 של מודל המקור של מטא. המספר הזה מראה פער קיצוני ביכולת לנסח טקסט, לפתור בעיות היגיון ולשמור על דקדוק תקין בקוריאנית, תחומים שבהם מודלי בסיס מערביים נוטים להתרסק.

מתאים ל

  • שירות לקוחות בקוריאנית

    מענה טבעי ומדויק ללקוחות דוברי קוריאנית בלי ליפול בשגיאות ניסוח או דקדוק מוזרות.

  • לוקליזציה לשוק הקוריאני

    תרגום, התאמת תוכן וכתיבה שיווקית מאנגלית לקוריאנית שמתאימים לתרבות המקומית.

  • ניתוח טקסטים בקוריאנית

    מיצוי תובנות וסיכום של פניות או מסמכים קצרים שכתובים בקוריאנית שוטפת.

איפה זה נופל

חלון ההקשר מוגבל ל־8,192 טוקנים, בניגוד לחלונות הענק של 128 אלף שקיימים במקור של לאמה 3.1, מה שפוסל אותו מניתוח מסמכים ארוכים או ספרים שלמים. בנוסף, הוא מתמקד אך ורק בקוריאנית ובאנגלית, כך שכל ניסיון לתשאל אותו בעברית או בשפות אחרות ייתן תוצאות גרועות, ובמתמטיקה הציונים שלו במבחן עדיין נמוכים משמעותית משאר היכולות שלו.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

המודל אומן ונבדק אך ורק על קוריאנית ואנגלית. לא כדאי לבנות עליו לעברית, כי מודלי שמונה מיליארד שמכווננים לשפה מסוימת בדרך כלל מייצרים ג'יבריש או ניסוחים שבורים בשפות אחרות.

האם אפשר להשתמש בו לקבצים ארוכים?

הוא מוגבל ל־8,192 טוקנים בלבד. אם יש לכם שיחות ארוכות במיוחד או קובצי טקסט כבדים, המודל הזה יחתוך אותם ולא יתאים למשימה בלי לחלק את המידע לחלקים קטנים.

איך מריצים

כדי להריץ אותו דרך transformers בגרסה 4.43.0 ומעלה, אתם מושכים כמעט 16 ג'יגה בייט של משקולות בדיוק bfloat16. זה אומר שצריך כרטיס מסך אחד עם 24 ג'יגה זיכרון כדי לעבוד בצורה נוחה ולשמור מקום לחלון הקשר של 8,192 טוקנים.

אם תשתמשו בקוונטיזציה אפשר להוריד את הדרישות לחומרה ביתית צנועה יותר, אבל אם כל מה שאתם צריכים זה שאילתה קוריאנית פעם בשבוע, החזקת שרת ייעודי כזה פשוט תעלה יותר מדי כסף.

from transformers import pipeline

pipe = pipeline("text-generation", model="NCSOFT/Llama-VARCO-8B-Instruct")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הקהילתי של לאמה 3.1, שמתיר שימוש מסחרי חופשי לרוב החברות כל עוד מספר המשתמשים הפעילים לא חוצה 700 מיליון בחודש, ומחייב לשמור על תנאי ההפצה של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗