GPT
O

OLMoE-1B-7B-0924-Instruct

קוד פתוח

allenaiapache-2.02024-08-13

  • transformers
  • safetensors
  • olmoe
  • text-generation
  • moe

תקבלו ביצועים של מודל 7B בעלות חישוב של 1B בלבד. הוא מתאים למי שרוצה מהירות גבוהה על שרת מקומי ולא מוכן להתפשר על איכות התשובות.

  • 6.9Bפרמטרים
  • 4,096טוקנים בהקשר
  • 12.9 GBמשקל הקבצים
  • 13,951הורדות בחודש

מה זה

מדובר במודל מסוג Mixture of Experts שמחזיק כמעט 7 מיליארד פרמטרים בסך הכול, אבל מפעיל רק מיליארד אחד בכל טוקן. השיטה הזו חוסכת כוח עיבוד בזמן ריצה בלי למחוק את הידע שנצבר באימון. הצוות של allenai כיוונן אותו בשני שלבים, קודם SFT ולאחר מכן DPO, כדי שיידע לעקוב אחרי הוראות בצורה מדויקת.

במבחני ביצועים הוא עוקף את הדור הקודם של המודלים המלאים בגודל הזה, במיוחד במעקב אחרי הנחיות (IFEval של 48.1 לעומת 37.9 בגרסת ה־7B הרגילה) ובדירוג תשובות מול מודלים אחרים ב־Alpaca Eval. מצד שני, במשימות חשיבה מורכבות כמו BBH או שאלות מתמטיות ב־GSM8k, מתחרים כמו DeepSeek או Qwen עדיין מובילים עליו בפער קטן.

מתאים ל

  • עוזר שיחה למכשירים מקומיים

    זמן התגובה שלו מהיר מאוד בזכות הפעלה של 1B פרמטרים בלבד בכל צעד.

  • מעקב אחר הוראות מובנות

    הוא משיג ציון IFEval גבוה שמראה על דיוק בפורמטים מורכבים באנגלית.

  • מחקר על מודלי מומחים

    allenai פרסמו את הקוד, הנתונים והמשקלים באופן מלא ושקוף לחלוטין.

איפה זה נופל

המודל הזה אומן ותועד עבור אנגלית בלבד. אין שום תיעוד לתמיכה בעברית, ולכן לא הייתי בונה עליו לשום שימוש בשפה המקומית בלי לבדוק אותו ביסודיות קודם. חלון ההקשר שלו מוגבל ל־4,096 טוקנים, שזה מעט מאוד ביחס לסטנדרט הנוכחי ולא יתאים למי שמנסה לקרוא מסמכים ארוכים או קבצי קוד מורכבים.

אותה משפחה

OLMoE-1B-7B-0924 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ מהר יותר ממודל 7B רגיל?

כן, משמעותית. בזמן הריצה המעבד מחשב רק כמיליארד פרמטרים מתוך השבעה, מה שנותן מהירות הפקה שמזכירה מודל 1B קטן, לצד איכות תוכן שקרובה למודלים גדולים בהרבה.

האם אפשר להריץ אותו על מחשב בלי כרטיס מסך ייעודי?

זה אפשרי טכנית כי חישוב של 1B הוא קל יחסית גם למעבד, אבל הקבצים עדיין שוקלים כמעט 13GB. המחשב יצטרך כמות גדולה של זיכרון RAM רגיל רק כדי להחזיק את המודל פתוח.

איך מריצים

כדי להריץ אותו צריך זיכרון שיכול להחזיק את כל 13 הג'יגה בייט של המשקלים, למרות שבפועל החישוב קל מאוד. כרטיס מסך ביתי בודד עם 16GB VRAM יספיק לריצה ב־bfloat16. אם הזיכרון שלכם גבולי, עדיף להמתין לקוונטיזציה או לפנות ל־API חיצוני, כי המודל חייב לשבת במלואו בזיכרון גם כשרק חלק קטן ממנו פעיל.

מבחינת תוכנה, נדרשת התקנה של ספריית transformers ישירות מגרסת הפיתוח בגיטהאב כדי לתמוך בארכיטקטורה. בנוסף לגרסה הראשית יש בעמוד גם ענפים עם אופטימיזציית KTO או בלי שלב ה־annealing, אבל גרסת ה־DPO הרגילה מציגה את התוצאות הטובות ביותר במבחנים.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/OLMoE-1B-7B-0924-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להפיץ אותם מחדש ולשלב אותם במוצר סגור בלי לשלם תמלוגים, כל עוד שומרים על הודעת הרישיון המקורית של היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗