GPT
L

L3-Grand-Story-Darkness-MOE-4X8-24.9B-e32-GGUF

קוד פתוח

DavidAUapache-2.02025-01-03

  • gguf
  • mixture of experts
  • moe
  • 4x8B
  • 32 bit enhanced

שילוב של ארבעה מודלי שמונה מיליארד לתערובת מומחים אחת. הוא מיועד למי שמחפש כתיבה עלילתית ומשחקי תפקידים באנגלית בלי צנזורה, עם טון אפל ומשקל של עשרים וחמישה מיליארד פרמטרים.

  • 312 GBמשקל הקבצים
  • 2,819הורדות בחודש
  • 44לייקים

מה זה

החיבור הזה מרכז ארבעה מודלים מבוססי לאמה 3, ביניהם סת'ינו, לומימייד, ג'אמט וגוטנברג. הרעיון הוא תערובת מומחים של ארבעה נתיבים סך הכול, כשבברירת המחדל רצים שניים בכל טוקן, אבל אפשר להגדיר שימוש במומחה בודד ועד כולם יחד. הוא נבנה ברמת דיוק מקורית של שלושים ושתיים ביט כדי לשמור על מעקב הוראות ואיכות טקסט, ומציג ציון פרפלקסיטי נמוך יותר מלאמה 3 אינסטראקט הרגיל.

בניגוד למודלים כלליים, המטרה כאן היא פרוזה עשירה בפרטים, דיאלוגים וסצנות אקשן או אימה. הטקסט נוטה לכיוון קודר באופן מובנה, ומסוגל להפיק תכנים קשים וגרפיים ללא חסימות. התבנית המומלצת היא לאמה 3 או קומאנד אר, כאשר שינוי התבנית או מספר המומחים הפעילים משנה לגמרי את אופי התשובות.

מתאים ל

  • משחקי תפקידים אפלים

    מנוע חופשי מצנזורה לניהול דמויות ועלילות אימה או מתח, שמתמודד היטב עם טמפרטורה גבוהה והוראות מורכבות.

  • כתיבת פרוזה וסיפורת

    פיתוח סצנות, דיאלוגים מורכבים ותיאורים חושיים מפורטים באנגלית לסופרים שמחפשים סגנון עשיר ולא מכני.

  • בניית עולמות ונרטיב

    יצירת קווי עלילה, טוויסטים וקונפליקטים עמוקים בזכות שילוב סגנונות הכתיבה של ארבעת המודלים המרכיבים.

איפה זה נופל

הוא לא מתאים למשימות קוד, שליפת מידע מדויק, מתמטיקה או שימושים עסקיים. המודל לא מצונזר לחלוטין, מוטה לאימה ולאלימות, ועלול לפלוט קטעים בוטים גם בלי שביקשתם במפורש. חלון ההקשר נעצר בשמונת אלפים טוקנים, כך שהוא לא יחזיק ספרים שלמים או מסמכים ארוכים.

הבחירה הדינמית במומחים גורמת לשונות גבוהה מאוד בין ריצות. אותו הפרומפט יכול להניב תוצאה מצוינת בפעם אחת וטקסט לא יציב בפעם הבאה, מה שמחייב לעיתים קרובות לייצר מחדש שלוש או ארבע פעמים. בנוסף, הוא מאומן באנגלית בלבד, ואין לצפות ממנו לעברית תקינה.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד, וכל המומחים שנכנסו למיזוג התמקדו בפרוזה באנגלית. ניסיון לכתוב איתו בעברית יפיק כנראה טקסט שבור, הזיות או מענה באנגלית.

כמה מומחים כדאי להפעיל בהרצה מקומית?

ברירת המחדל היא שניים, והיא נותנת איזון סביר בין קצב הטוקנים לאיכות הכתיבה. הפעלה של כל ארבעת המומחים תיתן תוצר עשיר יותר ומעקב מדויק יותר אחרי הנחיות, אבל תאט משמעותית את המהירות על כרטיסי מסך ביתיים.

למה התוצאות משתנות כל כך בכל פעם שלוחצים צור מחדש?

ארכיטקטורת המיזוג בוחרת מומחים שונים באופן דינמי במהלך יצירת הטקסט. מכיוון שמדובר בארבעה מודלים שונים בעלי סגנון ייחודי, כל ריצה משלבת אותם אחרת, ולכן מומלץ להריץ פעמיים או שלוש כדי לבחור את הכיוון הטוב ביותר.

איך מריצים

כדי להריץ מודל של עשרים וחמישה מיליארד פרמטרים תצטרכו כרטיס מסך עם עשרים וארבעה גיגה בייט זיכרון לקוואנטים בינוניים, או שילוב של כרטיס חזק וזיכרון מערכת מהיר. קובצי המאקס מעבירים חלק מהחישוב למעבד כדי לחסוך זיכרון גרפי, מה שמאפשר להריץ איכות גבוהה יותר במחיר של קצב יצירת טוקנים איטי יותר. אפשר לטעון אותו ישירות בכלים כמו קובולד סי פי פי, אל אם סטודיו או טקסט ג'נריישן ווב יו איי, שבהם קובעים את מספר המומחים הפעילים ואת פקטור ההחלקה.

המודל מגיב חזק לטמפרטורה גבוהה של אחד וחצי ומעלה, ודורש שימוש בסמפלרים מתקדמים כמו דיינמיק טמפ כדי להוציא ממנו את המיטב. אם אין לכם חומרה ייעודית מקומית עם שפע זיכרון וידאו, הניסיון לדחוף את כל ארבעת המומחים יחד יזחל, ובמקרה כזה עדיף לשכור שרת ענן לפי שעה או להשתמש בשרת אירוח חיצוני.

ollama run hf.co/DavidAU/L3-Grand-Story-Darkness-MOE-4X8-24.9B-e32-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא אפאצ'י שתיים אפס. הוא מתיר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. יחד עם זאת, מדובר במיזוג של מודלים מקהילת הקוד הפתוח שחלקם עברו התאמות שונות, כך שאם אתם בונים מוצר מסחרי, כדאי לבדוק גם את תנאי המקור של ארבעת המודלים שהרכיבו אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗