GPT
J

jetmoe-8b

קוד פתוח

jetmoeapache-2.02024-03-25

  • transformers
  • safetensors
  • jetmoe
  • text-generation
  • endpoints_compatible

מודל שפה בארכיטקטורת תערובת מומחים שמציע ביצועים של מודלים גדולים יותר עם חישוב של שני מיליארד פרמטרים בלבד. הוא מתאים למי שרוצה עלויות הסקה נמוכות בלי לוותר על תוצאות תחרותיות.

  • 8.5Bפרמטרים
  • 4,096טוקנים בהקשר
  • 15.9 GBמשקל הקבצים
  • 12,446הורדות בחודש

מה זה

המודל מחזיק 8.5 מיליארד פרמטרים בסך הכול, אבל מפעיל רק 2.2 מיליארד בכל טוקן בזכות פיצול לשמונה מומחים בשכבות הקשב והעיבוד, מתוכם שניים פעילים בו זמנית. הוא אומן על 1.25 טריליון טוקנים ממאגרים ציבוריים בלבד בתקציב נמוך של פחות ממאה אלף דולר, שכלל צביר של 96 כרטיסי H100 לשבועיים.

במדדי הביצועים של הלוח הפתוח הוא עוקף את LLaMA2-7B בממוצע הכולל עם ציון 53 לעומת 51, ומציג יתרון בולט במשימות מתמטיקה כמו GSM8k עם 27.8 לעומת 14.5. מול מודלים קטנים עם כוח חישוב דומה כמו Gemma-2B, הוא מוביל כמעט בכל מבחן.

מתאים ל

  • הסקה חסכונית בשרתים

    צריכת חישוב של 2.2 מיליארד פרמטרים מאפשרת תפוקת טוקנים מהירה ועלויות שרת נמוכות משמעותית ממודלי 7B רגילים.

  • כוונון על חומרה ביתית

    מבנה המומחים והדרישות הנמוכות מאפשרים לבצע fine-tuning בתקציב נמוך על כרטיסי מסך צרכניים.

  • פתרון בעיות היגיון וחישוב

    מציג ציון של 27.8 במבחן GSM8k, גבוה בהרבה ממתחרים בגודל דומה, מה שמסייע בשאלות חשבון והסקה.

איפה זה נופל

למרות ההובלה במתמטיקה, הוא נופל במבחני תכנות מורכבים כמו HumanEval עם ציון של 14.6 בלבד, לעומת DeepseekMoE-16B שהגיע ל־25, כך שהוא לא מתאים לכתיבת קוד עצמאית. חלון ההקשר שלו מוגבל ל־4,096 טוקנים, מעט מאוד בהשוואה לסטנדרט הנוכחי.

בנוסף, הריצה דורשת קוד מותאם אישית שרושם את הארכיטקטורה לתוך transformers, ולא נתמכת ישר מהקופסה בכל תשתית הרצה סטנדרטית.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה עם שיחות?

הגרסה הזו היא מודל בסיס שנועד להשלמת טקסט ולא לשיחה. כדי לבנות עוזר וירטואלי עדיף להוריד ישירות את JetMoE-8B-Chat שעבר אימון ייעודי למילוי הוראות.

איך אפשר לטעון אותו אם transformers לא מכירה אותו?

הכרטיס מחייב התקנה של החבילה של MyShell מגיטהאב. לאחר מכן רושמים את המחלקות JetMoEForCausalLM ידנית מול הספרייה לפני טעינת המשקלים.

איך מריצים

כדי להריץ אותו צריך להוריד חבילה ייעודית מגיטהאב ולהשתמש במחלקות מותאמות של transformers. המשקל שלו בזיכרון תופס כמעט 16 ג'יגה בייט, כך שאי אפשר להסתפק בכרטיס מסך פשוט עם 8 או 12 ג'יגה בייט עבור משקלים מלאים, אלא צריך כרטיס עם 24 ג'יגה בייט כמו RTX 3090 או 4090, או לבצע קוונטיזציה.

אם אתם צריכים צ'אט ולא בסיס גולמי, יש גרסאות ייעודיות של כוונון והוראות. כשאין ברשותכם כרטיס חזק או כשצריכים שירות יציב בלי להגדיר קוד חיצוני, עדיף להשתמש בדמו ב־Lepton AI או ב־API קיים במקום להסתבך עם הגדרות סביבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="jetmoe/jetmoe-8b")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗