GPT
O

OpenELM-3B

קוד פתוח

appleapple-amlr2024-04-12

  • transformers
  • safetensors
  • openelm
  • text-generation
  • custom_code

מודל שפה קומפקטי מבית אפל שתוכנן לחלוקת פרמטרים יעילה בין השכבות. שווה לבדוק אותו אם אתם מחפשים בסיס קל לאימון עצמי במקום עוד שכפול של אותה ארכיטקטורה.

  • 3Bפרמטרים
  • 11.3 GBמשקל הקבצים
  • 810הורדות בחודש
  • 130לייקים

מה זה

מדובר במודל הבסיס הגדול ביותר בסדרת OpenELM של אפל, שכוללת גדלים שנעים בין 270 מיליון ל־3 מיליארד פרמטרים. הרעיון המרכזי פה הוא Layer-wise scaling, כלומר הקצאה לא אחידה של פרמטרים בין שכבות הטרנספורמר כדי להפיק יותר ביצועים מכל משקל. הוא אומן על מאגר נתונים פתוח של כ־1.8 טריליון טוקנים שכולל את RefinedWeb, PILE, RedPajama ו־Dolma.

במבחני ביצועים הוא מציג תמונה מעורבת. הוא מגיע ל־92.70 ב־SciQ ומשיג 72.44 ב־HellaSwag, שזה מרשים למשקל שלו, אבל ב־MMLU הוא נעצר על 26.76 בלבד, תוצאה שמגרדת ניחוש אקראי ומראה חולשה בידע כללי מורכב. הוא לא בא לנהל שיחות פתוחות עם משתמשי קצה, אלא לשמש אבן בניין יעילה למחקר או להתאמה אישית.

מתאים ל

  • מחקר על ארכיטקטורת שכבות

    החלוקה הייחודית של המשקלים בין השכבות מאפשרת לבחון יעילות חישובית מול מודלים סטנדרטיים.

  • בסיס לכוונון במשימות צרות

    גודל של 3 מיליארד פרמטרים הופך אותו למתאים ל־fine-tuning על משימות ספציפיות כמו סיווג טקסט.

  • מודל מטרה לניסויי האצה

    מתאים לבדיקת speculative decoding יחד עם הדגמים הקטנים בסדרה כדי לשפר זמני תגובה.

איפה זה נופל

המודל הזה הוא גרסת בסיס ולא עבר fine-tuning להוראות, מה שאומר שהוא ימשיך טקסט ולא יענה לפקודות בצורה מסודרת. ב־TruthfulQA הוא מוציא ציון של 34.98 בלבד, נמוך יותר מחלק מהגרסאות הקטנות שלו, מה שמלמד על נטייה להזיות ופול פוזיטיב.

בנוסף, אפל מדגישה מפורשות שהוא שוחרר ללא בדיקות בטיחות או סינון פלטים. הוא אומן על נתונים גולמיים מהרשת, כך שאם לא תלבישו עליו מנגנוני סינון ובקרה, הוא עלול לייצר טקסט פוגעני או שגוי לחלוטין.

אותה משפחה

OpenELM יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין וכותב עברית?

הוא אומן על מאגרי מידע באנגלית כמו RefinedWeb ו־Dolma, ולכן הידע שלו בעברית לא נבדק וצפוי להיות מינימלי או לא קיים. אם הפרויקט שלכם דורש עברית כשפת מקור, המודל הזה לא יתאים בלי אימון משמעותי מראש.

האם כדאי להוריד אותו במקום מודל Instruct?

לא אם אתם מחפשים מודל שמגיב לשאלות ופקודות. הגרסה הזו מיועדת להשלמת טקסט, ובמדדים הרשמיים OpenELM-3B-Instruct מנצח אותה כמעט בכל מבחן, כולל 76.36 ב־HellaSwag לעומת 72.44 כאן.

איך מריצים

כדי להריץ אותו צריך להוריד כ־11.3 גיגה־בייט של קבצים ולהשתמש בספריית transformers עם טוקן גישה מ־Hugging Face. בגלל שהמשקלים שמורים ב־float32, תצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לטעון אותו כמו שהוא, אלא אם תמירו אותו לדיוק נמוך יותר.

הקוד שצורף תומך גם ב־speculative generation, שמאפשר להאיץ את התגובה בעזרת מודלים קטנים יותר מהסדרה כמו ה־270M או חיפוש טוקנים בפרומפט. אם המטרה היא צ'אט או מענה שאלות מוכן בלי להשקיע שעות באימון, עדיף בהרבה לקחת מודל Instruct או לשלם סנטים בודדים ל־API מסחרי.

from transformers import pipeline

pipe = pipeline("text-generation", model="apple/OpenELM-3B")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון ייעודי של אפל בשם apple-amlr. הרישיון מכוון בעיקרו להפצה לצורכי מחקר פתוח וקהילה אקדמית. אם אתם מתכננים להכניס אותו לקוד מסחרי או למוצר רווחי, אתם חייבים לקרוא את תנאי הרישיון המלאים ובנוסף לבדוק את תנאי השימוש של מאגרי האימון המקוריים שלו.

הרישיון המלא בעמוד המודל ↗