GPT
F

FlexOlmo-7x7B-1T

קוד פתוח

allenaiapache-2.02025-06-11

  • transformers
  • safetensors
  • flex_olmo
  • text-generation
  • moe

ארכיטקטורת תערובת מומחים שמחברת מודלים שאומנו על מקורות מידע נפרדים. מתאים למי שחוקר שיתוף פעולה בדאטה או רוצה מודל פתוח עם שליטה על תרומת מקורות המידע.

  • 33Bפרמטרים
  • 4,096טוקנים בהקשר
  • 124 GBמשקל הקבצים
  • 9,021הורדות בחודש

מה זה

מדובר במודל תערובת מומחים עם 33 מיליארד פרמטרים ו־32 שכבות, שמשלב שבעה מומחים עצמאיים. מומחה הבסיס אומן על טריליון טוקנים של מידע ציבורי, וממנו פוצלו מומחים נוספים שאומנו על 50 מיליארד טוקנים בתחומי חדשות, מתמטיקה, קוד, טקסט אקדמי, כתיבה יוצרת ורדיט. הרעיון הוא לאפשר לבעלי מידע לחבר או לנתק את המומחה שלהם בלי לחשוף נתונים גולמיים.

הגרסה הזו מגיעה ללא אימון נתב, מה שמשפיע ישירות על הביצועים. במבחנים הוא מקבל ציון ממוצע של 39.3, נמוך משמעותית מגרסת הניתוב המאומן שעומדת על 52.0 וגם ממודל הבסיס הציבורי שקיבל 42.4. במתמטיקה הוא מגיע ל־25.4 נקודות ובקוד ל־10.6 בלבד, תוצאות שממחישות את הפער בין הרעיון הארכיטקטוני ליכולת של הגרסה הספציפית הזו לייצר תוכן איכותי בפועל.

מתאים ל

  • מחקר ארכיטקטורות מומחים

    ניתוח התנהגות מודל שמשלב מומחים שאומנו בנפרד ללא שכבת ניתוב ייעודית.

  • בדיקת שיתוף מידע מבוזר

    בחינת מנגנון שמאפשר הוספה והסרה של מקורות מידע מבלי לחשוף את הדאטה המקורי.

  • ניתוח ייחוס פלטים לדאטה

    מעקב אחר המומחה הפעיל בזמן הסקה כדי לתת קרדיט למקורות המידע שהשתתפו בהפקת התשובה.

איפה זה נופל

החיסרון המרכזי הוא שמדובר בגרסה ללא אימון נתב, ולכן הביצועים שלה חלשים משמעותית כמעט בכל מדד לעומת גרסת הניתוב המאומן. במבחני קוד הוא מקבל ציון של 10.6, ובמבחן MMLU Pro הוא מגיע ל־22.1 בלבד. בנוסף, חלון ההקשר קצר מאוד ועומד על 4,096 טוקנים בלבד. המודל תומך באנגלית בלבד, ואין לו יכולת מובנית בעברית. לא כדאי לבנות עליו למוצר שדורש יצירת קוד או ניתוח טקסטים ארוכים.

שאלות
נפוצות

האם המודל מתאים לפיתוח תוכנה או יצירת קוד?

התוצאות שלו במבחני קוד נמוכות מאוד ועומדות על 10.6 נקודות במדד Code4. אם אתם צריכים סיוע בפיתוח, מומחה הקוד הנפרד או מודל ייעודי אחר ייתנו תוצאה עדיפה.

מה ההבדל בין המודל הזה לגרסת RT?

הגרסה הזו פורסמה ללא אימון נתב, בעוד גרסת RT כוללת ניתוב מאומן. ההבדל בביצועים גדול, כאשר גרסת הניתוב המאומן מובילה כמעט בכל המבחנים בממוצע של 52.0 לעומת 39.3 כאן.

איך מריצים

כדי להריץ אותו צריך להוריד 124 גיגה בייט של משקלים המחולקים ל־36 קבצים, מה שמחייב שרת ייעודי עם מספר כרטיסי מסך חזקים כדי להחזיק 33 מיליארד פרמטרים בזיכרון. ההרצה מתבצעת ישירות דרך ספריית transformers מגרסה 4.57.0 ומעלה יחד עם הטוקנייזר dolma2.

אם אתם שוקלים להרים שרת בשביל זה בענן, העלויות יהיו גבוהות ביחס לתמורה של מודל נטול נתב מאומן. כרגע לא ידוע על ספקי API צד שלישי שמגישים את המימוש הספציפי הזה, כך שאם אתם לא חוקרים את שיטת החיבור של המומחים, עדיף לפנות למודלים מנוהלים רגילים.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/FlexOlmo-7x7B-1T")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית של המערכת בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗