GPT
O

OpenELM-3B-Instruct

קוד פתוח

appleapple-amlr2024-04-12

  • transformers
  • safetensors
  • openelm
  • text-generation
  • custom_code

גרסת שלוש מיליארד פרמטרים של אפל שעברה התאמה להוראות. היא נבנתה לחלוקת משאבים יעילה בין השכבות כדי לתת ביצועים מקסימליים בחומרה מקומית.

  • 3Bפרמטרים
  • 5.7 GBמשקל הקבצים
  • 559הורדות בחודש
  • 338לייקים

מה זה

מדובר במודל שפה קומפקטי שאומן על 1.8 טריליון טוקנים ממאגרים פתוחים כמו RefinedWeb ו־Dolma. בניגוד לרוב מודלי השפה בגודל הזה, המבנה הפנימי שלו משתמש בהקצאת פרמטרים משתנה בכל שכבה. הרעיון הוא לתת ביצועים טובים יותר לכל פרמטר בלי לנפח את המודל.

גרסת ההוראות הזו עוקבת אחרי פקודות ומגיעה לתוצאות נאות במבחני ידע כללי כמו HellaSwag עם 76.87 נקודות. מצד שני, במבחן MMLU התוצאה עומדת על 24.8 נקודות בלבד. זה ציון נמוך מאוד, ששקול כמעט לניחוש אקראי, מה שמראה שהמודל מתקשה בהבנה מעמיקה ובהסקה רב-תחומית מורכבת בהשוואה למודלים ייעודיים לתשובות מדויקות.

מתאים ל

  • מחקר על יעילות שכבות

    מתאים לבדיקת שיטות דחיסה וחלוקת פרמטרים משתנה על מודל אימון פתוח לחלוטין.

  • ניסויי ייצור טקסט מקומי

    מאפשר הרצה מלאה על מחשב נייד חזק ללא תלות ברשת או שירותי ענן חיצוניים.

  • האצת הסקת מודלים

    משמש כבסיס לבדיקת speculative decoding יחד עם הדגמים הקטנים יותר בסדרה.

איפה זה נופל

היוצרים מצהירים בפירוש שהמודל שוחרר ללא שום שכבות בטיחות או מנגנוני סינון. המשמעות היא שהוא עלול לפלוט טקסט פוגעני, מוטה או שגוי לחלוטין. לפני שחושבים לחבר אותו לממשק משתמש, חובה להוסיף מנגנוני סינון ובדיקות עצמאיות. בנוסף, חולשת המודל במבחני ידע כמו MMLU דורשת להימנע משימוש בו למשימות שדורשות דיוק עובדתי גבוה.

אותה משפחה

OpenELM יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש באפליקציה מסחרית?

לא מומלץ כרגע. הרישיון שלו הוא apple-amlr שמיועד בעיקר לצרכי מחקר, ובנוסף אפל מציינת במפורש שאין עליו שכבות בטיחות.

האם כדאי להשתמש בו לניתוח טקסטים ארוכים ועובדתיים?

עדיף שלא. הציון הנמוך במבחן MMLU מעיד על קושי בהבנת עובדות מורכבות, ולכן הוא נוטה להמציא מידע במשימות עיוניות.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.7 גיגה-בייט בפורמט bfloat16. כדי להריץ אותו מקומית בלי תקיעות צריך כרטיס מסך עם לפחות 8 גיגה-בייט של זיכרון גרפי, או מחשב מק עם זיכרון מאוחד. ההרצה נעשית ישירות דרך ספריית transformers בפייתון יחד עם טוקן גישה מ־HuggingFace.

אפשר להאיץ את תהליך ייצור הטקסט באמצעות speculative generation, למשל על ידי חיבור מודל עזר קטן יותר מאותה משפחה, כמו גרסת 270M. אם המטרה שלכם היא רק לקבל טקסט מנוסח היטב ולא מעניין אתכם מחקר או ריצה מקומית על המכשיר, שימוש ב־API חיצוני של שירות ענן יחסוך את כאב הראש של הקינפוג והחומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="apple/OpenELM-3B-Instruct")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון ייעודי של אפל בשם apple-amlr. מדובר ברישיון מחקרי שמטרתו לאפשר מחקר פתוח וניסויים על המבנה והאימון. הרישיון אינו רישיון קוד פתוח סטנדרטי מסוג MIT או Apache, ולכן הוא לא מיועד להטמעה ישירה במוצרים מסחריים סגורים בלי בדיקה משפטית של תנאי השימוש.

הרישיון המלא בעמוד המודל ↗