GPT
O

OLMoE-1B-7B-0125

קוד פתוח

allenaiapache-2.02025-01-21

  • transformers
  • safetensors
  • olmoe
  • text-generation
  • moe

זה מודל מסוג Mixture-of-Experts שמפעיל רק 1.3 מיליארד פרמטרים בכל מעבר, מתוך 6.9 מיליארד בסך הכול. הוא מציע שקיפות מלאה באימון יחד עם מהירות חישוב גבוהה.

  • 6.9Bפרמטרים
  • 4,096טוקנים בהקשר
  • 25.8 GBמשקל הקבצים
  • 17,153הורדות בחודש

מה זה

מדובר במודל בסיס פתוח לחלוטין מבית allenai, שכולל לא רק משקלים אלא גם קוד, נתוני אימון מלאים ולוגים של הריצה. הארכיטקטורה מחלקת את העבודה בין מומחים שונים, כך שזמן הריצה פר טוקן תואם למודל קטן של מיליארד פרמטרים, אבל איכות הייצוג נשענת על נפח גדול בהרבה.

במבחני ידע והיגיון כמו MMLU עם ציון 56.3 ו־HellaSwag עם 81.7, הוא עוקף בבירור מודלים של מיליארד פרמטרים כמו DCLM-1B ו־TinyLlama, ואפילו מציג תוצאות דומות או עדיפות על מודלים דחוסים של שניים ושלושה מיליארד כמו Gemma2-3B. מול מודלים מלאים של שבעה מיליארד הוא עדיין מפגר בביצועים, אבל הוא דורש שבריר מכוח החישוב שלהם פר טוקן.

מתאים ל

  • אימון מותאם על שרת בודד

    בסיס מעולה לפיין טיונינג פנימי בזכות שקיפות מלאה של דאטהסט האימון ודרישות חישוב נמוכות יחסית.

  • מחקר ארכיטקטורות MoE

    מאפשר לבחון התנהגות ניתוב מומחים ולוגים פתוחים לחלוטין ללא חלקים קנייניים מוסתרים.

  • השלמת טקסט באנגלית בזמן אמת

    מייצר טקסט במהירות של מודל 1.3B קל משקל תוך שמירה על איכות תשובות של מודל גדול יותר.

איפה זה נופל

זהו מודל בסיס להשלמת טקסט, לא מודל שיחה שמבין שאלות ותשובות מהקופסה. אם תשלחו לו הנחיה, הוא פשוט ימשיך את המשפט. חלון ההקשר שלו קצר ועומד על 4,096 טוקנים בלבד, מה שמגביל מאוד ניתוח מסמכים ארוכים. בנוסף, הוא אומן באנגלית בלבד ולכן שימוש בעברית ייכשל או יחזיר ג'יבריש מוחלט.

אותה משפחה

OLMoE-1B-7B-0125 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה עם טקסטים בעברית?

לא. נתוני המודל והאימון מוגדרים עבור השפה האנגלית בלבד. ניסיון לייצר בעזרתו פלט בעברית לא יעבוד בצורה סבירה.

למה צריך כרטיס מסך גדול אם הוא מפעיל רק 1.3 מיליארד פרמטרים?

בארכיטקטורת MoE כל המשקלים חייבים להיות טעונים בזיכרון ה־VRAM בו זמנית, גם אם בכל רגע נתון רק חלק קטן מהם משתתף בחישוב. לכן נפח הזיכרון הנדרש נקבע לפי 6.9 מיליארד הפרמטרים ולא לפי ה־1.3 הפעילים.

האם כדאי להוריד אותו כצ'אטבוט לעסק?

לא. זו גרסת הבסיס שנועדה להשלמת טקסט או כבסיס לפיתוח נוסף. למטרות שיחה צריך להשתמש בגרסאות ה־Instruct או ה־SFT שהקבוצה פרסמה בנפרד.

איך מריצים

כדי להריץ אותו צריך transformers בגרסה 4.45 ומעלה יחד עם PyTorch. למרות שבאינפרנס מחושבים רק כ־1.3 מיליארד פרמטרים, כל 6.9 מיליארד הפרמטרים חייבים לשבת בזיכרון, מה שאומר שהקבצים שוקלים כ־25.8 גיגה בייט בפורמט הרגיל ותצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון אותו ישירות.

המשקלים מגיעים ב־BF16, כאשר קיימת גם גרסת fp32 בענף ייעודי אם אתם ממש מתעקשים על זה למחקר. אם המטרה היא שיחה עם משתמש או משימות הוראה, אל תריצו את הגרסה הזו ישירות אלא קחו את גרסאות ה־SFT או ה־Instruct שהארגון שחרר.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/OLMoE-1B-7B-0125")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ואימון המשך, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗