GPT
L

L3-8B-Lunaris-v1

קוד פתוח

Sao10Kllama32024-06-26

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

מיזוג של כמה מודלי Llama 3 שנועד למשחקי תפקידים וכתיבה יצירתית. המפתח כיוון לאיזון טוב יותר בין היגיון לדמיון ביחס לגרסאות קודמות שלו.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 980הורדות בחודש

מה זה

מדובר במיזוג מבוסס TIES של חמישה מודלים שונים על בסיס Llama 3 8B Instruct, כולל Stheno v3.2, Sunfall ודגמים נוספים של כתיבה וידע כללי. המטרה של המיזוג הזה היא לתת מענה לשיחות פתוחות, משחקי תפקידים ויצירת טקסט עלילתי, בלי לאבד לגמרי את יכולת ההיגיון והבנת ההקשר שהולכת לפעמים לאיבוד במיזוגים יצירתיים.

המפתח בחר את המשקלים מתוך ניסוי וטעייה אישיים ולא לפי מדדים אוטומטיים. ההגדרות המומלצות בכרטיס דורשות טמפרטורה גבוהה יחסית של 1.4 עם ערך min_p של 0.1, מה שמכוון מראש לסגנון כתיבה מגוון ולא צפוי, תוך שימוש בתבנית ההוראות המקורית של Llama 3.

מתאים ל

  • משחקי תפקידים באנגלית

    המיזוג נבנה במיוחד לאיזון בין יצירתיות לחוקיות בשיחות דמויות.

  • כתיבה יוצרת ועלילתית

    שילוב המודלים מרחיב את אוצר המילים ומשפר את זרימת הסיפור.

  • בוטים לשיחה חופשית

    מתאים לדיאלוגים ארוכים באנגלית שלא דורשים תשובות עובדתיות.

איפה זה נופל

המודל מוגדר רשמית לאנגלית בלבד, כך שאין מה לצפות לביצועים סבירים בעברית. המפתח מודה בעצמו שתהליך המיזוג הוא מעין קסם שחור שמבוסס על תחושות וניסויים אישיים, ולא פורסמו תוצאות של מבחני ביצועים מסודרים. הוא לא נבנה לקוד, משימות מובנות או שליפת עובדות מדויקת, ולכן לא מתאים לשמש מנוע מאחורי מוצר עסקי.

שאלות
נפוצות

האם כדאי להשתמש בו ליישום בעברית?

לא. המודל מתועד לאנגלית בלבד, וכל המודלים שמוזגו לתוכו כוונו לכתיבה באנגלית. ניסיון לעבוד איתו בעברית יפיק כנראה טקסט שבור או מבולבל.

למה מוגדרת טמפרטורה כל כך גבוהה?

היוצר ממליץ על טמפרטורה 1.4 בשילוב min_p 0.1 כדי לסנן טוקנים לא קשורים, אבל עדיין לשמור על סגנון כתיבה מגוון ומעניין ולא תשובות יבשות.

איך מריצים

המשקל הכולל של הקבצים בפורמט bfloat16 מגיע ל־15 גיגהבייט, כך שכדי להריץ אותו מקומית בלי קוונטיזציה צריך כרטיס מסך עם לפחות 16 עד 24 גיגהבייט זיכרון גרפי. אם אין לכם חומרה כזו, קוונטיזציה של 4 או 8 ביט תוריד את הדרישות לחומרה ביתית נפוצה יותר.

מי שרק רוצה לבדוק את התנהגות המודל או לשלב אותו בבדיקות נקודתיות יעדיף לשלוח קריאות לשרת מרוחק שמחזיק את המשקלים. הרצה מקומית משתלמת כאן רק אם יש לכם צורך בפרטיות מוחלטת בשיחות או שאתם מפתחים ממשק שמתבסס ספציפית על סגנון הכתיבה הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Sao10K/L3-8B-Lunaris-v1")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3 של מטא, שמאפשר שימוש מסחרי ומחקר כל עוד עומדים במגבלות המקוריות של פייסבוק, כולל תקרת משתמשים חודשיים של מאות מיליונים והגבלות על אימון מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗