GPT
B

Beyonder-4x7B-v3

קוד פתוח

mlabonnecc-by-nc-4.02024-03-21

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • moe

שילוב של ארבעה מודלים שונים לתוך ארכיטקטורת מומחים אחת בגודל 24B. הוא פונה למי שמחפש מודל שמצטיין בכתיבה יוצרת ובמשחקי תפקידים בלי לוותר על קוד והיגיון כללי.

  • 24Bפרמטרים
  • 32,768טוקנים בהקשר
  • 45.0 GBמשקל הקבצים
  • 8,516הורדות בחודש

מה זה

מדובר בהרכבה מסוג Mixture of Experts שנעשתה באמצעות LazyMergekit על בסיס ארבעה מודלים שונים של 7B פרמטרים. כל מומחה מביא התמחות אחרת: AlphaMonarch לשיחה כללית, CodeNinja לפיתוח, Kunoichi למשחקי תפקידים וסיפורים, ו־NeuralDaredevil לחשיבה ומתמטיקה. בכל תשובה המודל מפעיל שני מומחים במקביל, מה שאמור לתת מענה שמשלב סגנון עשיר עם יכולת פתרון בעיות.

במבחני ביצועים הוא מציג תמונה מעניינת. במבחן EQ-Bench הוא עוקף מודלים גדולים בהרבה כמו Llama-2-70b-chat ומתקרב ל־Mixtral המקורי. בבנצ'מרק של Nous הוא מגיע לממוצע של 61.91 נקודות, שיפור משמעותי מגרסה 2, אם כי מודל הבסיס שלו AlphaMonarch עדיין עוקף אותו בממוצע הכללי בגלל ציונים עדיפים במבחני ידע כמו TruthfulQA.

מתאים ל

  • משחקי תפקידים ובוטים לשיחה

    השילוב של המומחה Kunoichi יחד עם ציוני EQ-Bench גבוהים מייצר שיחות עשירות עם אישיות יציבה.

  • כתיבה יוצרת ופיתוח עלילה

    חיבור מומחה הכתיבה עם מומחה החשיבה נותן מענה טוב ליצירת סיפורים שדורשים גם היגיון פנימי ועקביות.

  • עוזר פיתוח מקומי קל

    בגרסאות המכווצות הוא נותן מענה קוד נקודתי מבוסס CodeNinja ישירות מהמחשב האישי בלי תלות ברשת.

איפה זה נופל

היוצר עצמו מבהיר שהמודל לא תוכנן להצטיין במבחנים סינתטיים קלאסיים, כי מומחי קוד ומשחקי תפקידים נוטים לפגוע בציונים כאלה. במבחן TruthfulQA הוא איבד נקודות בהשוואה למודל הבסיס שלו, 74.98 לעומת 78.39, מה שאומר שהוא עלול להמציא עובדות ביתר קלות. בנוסף, למרות שהקונפיגורציה מציגה חלון של 32k, היוצר ממליץ בפועל על חלון של 8k בלבד. כדאי לזכור שאין פה שום אופטימיזציה או התאמה לשפה העברית.

אותה משפחה

Beyonder יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה חלון הקשר עובד איתו באמת, 8k או 32k?

הקונפיגורציה הטכנית תומכת בעד 32,768 טוקנים, אבל היוצר ממליץ במפורש להגביל את השימוש ל־8,000 טוקנים. מעבר לזה איכות הפלט עלולה לרדת משמעותית, במיוחד במשימות שדורשות זיכרון מדויק של פרטים.

איך כדאי להגדיר את הפרמטרים בתוכנות הרצה מקומיות?

היוצר מספק ערכים מומלצים מתוך LM Studio שמתאימים גם ל־SillyTavern. כדאי להגדיר טמפרטורה על 0.8, ערך top_k על 40, ערך top_p על 0.95, min_p על 0.05, ועונש על חזרתיות repeat_penalty על 1.1.

איך מריצים

כדי להריץ את גרסת ה־float16 המקורית תצטרכו כ־45 גיגה-בייט של זיכרון כרטיס מסך, מה שמחייב שני כרטיסי RTX 3090 או 4090, או כרטיס A100 אחד. בגלל שזה מודל מומחים רק חלק מהפרמטרים פעילים בכל טוקן, כך שמהירות היצירה גבוהה יחסית לגודל מלא, אבל המשקל בזיכרון עדיין נשאר כבד.

רוב המשתמשים לא יריצו את המשקלים הגולמיים. קיימות גרסאות מכווצות בפורמט GGUF ו־ExLlamaV2 שהכין המשתמש bartowski. כיווץ ל־4 ביט מוריד את דרישות הזיכרון לאזור ה־14 עד 16 גיגה-בייט, ומאפשר הרצה חלקה בכרטיס מסך ביתי בודד דרך תוכנות כמו LM Studio עם תבנית השיחה של Mistral Instruct.

from transformers import pipeline

pipe = pipeline("text-generation", model="mlabonne/Beyonder-4x7B-v3")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0. זהו רישיון לא מסחרי שמאפשר לכם להוריד, לשנות, לקוונטט ולהריץ את המודל לצרכי מחקר, פיתוח פנימי ושימוש אישי בלבד. אי אפשר לשלב אותו במוצר שמייצר הכנסה ישירה או עקיפה, ואי אפשר למכור גישה ל־API שמבוסס עליו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗