GPT
O

OLMoE-1B-7B-0924

קוד פתוח

allenaiapache-2.02024-07-20

  • transformers
  • safetensors
  • olmoe
  • text-generation
  • moe

מודל שפה בארכיטקטורת תערובת מומחים שדורש חישוב של מיליארד פרמטרים בלבד בכל טוקן, אך מחזיק ביצועים של מודלים צפופים גדולים בהרבה, בקוד פתוח מלא.

  • 6.9Bפרמטרים
  • 4,096טוקנים בהקשר
  • 12.9 GBמשקל הקבצים
  • 123,250הורדות בחודש

מה זה

מדובר בארכיטקטורת Mixture of Experts שמחזיקה כמעט שבעה מיליארד פרמטרים בסך הכול, אבל מפעילה רק כמיליארד ושלוש מאות מיליון פרמטרים פעילים בכל מעבר. זה אומר שמקבלים מהירות הסקה ועלות חישוב של מודל קטן מאוד, יחד עם קיבולת זיכרון של מודל בינוני.

במבחני ביצועים מול מודלים אחרים עם מיליארד פרמטרים פעילים, הוא מציג יתרון ברור. בבחינת MMLU הוא קיבל ציון של 54.1 לעומת 48.5 של DCLM-1B וסביב 33 של TinyLlama, ובמדד HellaSwag הוא הגיע ל־80.0. בפועל הוא עוקף בקלות מודלים קטנים, ואפילו מתחרה ברמה של מודלים ישנים פי כמה כמו Llama2 בגודל שבעה מיליארד פרמטרים, שקיבל 46.2 ב־MMLU.

מתאים ל

  • הסקה מהירה באנגלית

    חישוב של 1.3 מיליארד פרמטרים מאפשר קצב ייצור טוקנים גבוה במיוחד לעיבוד טקסטים.

  • בסיס לאימון מותאם אישית

    הקוד, הנתונים והמשקלים פתוחים לגמרי ומאפשרים Fine-Tuning מלא בלי הפתעות.

  • מחקר על תערובת מומחים

    מערך נתונים ויומני אימון פתוחים לגמרי של ארכיטקטורת MoE זמינים לבדיקה.

איפה זה נופל

זהו צ'קפוינט בסיסי בלבד שמיועד להשלמת טקסט, ולא עבר התאמה לשיחה, מענה לשאלות או קבלת הנחיות. אם תזינו לו פקודה ישירה הוא פשוט ימשיך את המשפט במקום לענות עליו. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים, והנתונים הרשמיים מציינים תמיכה באנגלית בלבד. לא הייתי בונה עליו שום תהליך שדורש עברית או מסמכים ארוכים.

אותה משפחה

OLMoE-1B-7B-0924 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין וכותב בעברית?

הכרטיס מציין רשמית רק אנגלית, ומערכי האימון התבססו על שפה זו. הוא עשוי לפלוט מילים בודדות בעברית אם נתקל בהן במקרה, אבל התוצאה תהיה משובשת ולא מתאימה לשימוש אמיתי.

האם אפשר להשתמש בו לצ'אט ישירות אחרי ההורדה?

לא, הדגם הזה הוא שלב ה־Pretraining ולא עבר כוונון להוראות. כדי לנהל איתו שיחה צריך להשתמש בגרסת ה־Instruct או לבצע עליו אימון SFT משלכם.

האם המודל צורך זיכרון וידאו כמו מודל 1B רגיל?

לא. למרות שהחישוב עצמו מקביל למודל קטן, כל 6.9 מיליארד הפרמטרים חייבים לשבת בזיכרון ה־VRAM, מה שמחייב כרטיס עם נפח של כ־16 ג'יגה בייט.

איך מריצים

כדי להריץ אותו צריך לטעון את כל 6.9 מיליארד הפרמטרים לזיכרון, גם אם החישוב בפועל מפעיל רק חלק קטן מהם. המשקל שלו תופס 12.9 ג'יגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 ג'יגה זיכרון כדי להריץ אותו בנוחות מקומית.

ההרצה נעשית דרך ספריית transformers הרגילה של פייתון באמצעות OlmoeForCausalLM. מי שמחפש רק לחסוך זיכרון עבודה לא ירוויח כאן לעומת מודל 7B רגיל, אבל מי שרוצה מהירות דגימה גבוהה בכרטיס תואם ירגיש מיד את ההבדל בזמן התגובה לכל טוקן.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/OLMoE-1B-7B-0924")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון apache-2.0. הרישיון מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד, אימון מחדש והפצה בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗