GPT
O

Olmo-Hybrid-7B

קוד פתוח

allenaiapache-2.02026-01-28

  • transformers
  • safetensors
  • olmo_hybrid
  • text-generation
  • en

שילוב של שכבות DeltaNet חוזרות בתוך ארכיטקטורת שנאי מקצץ את צריכת הזיכרון בהקשרים ארוכים. המודל מיועד למי שרוצה להריץ טקסטים כבדים מקומית בלי לרוקן את כרטיס המסך.

  • 7.4Bפרמטרים
  • 65,536טוקנים בהקשר
  • 13.9 GBמשקל הקבצים
  • 19,029הורדות בחודש

מה זה

הארכיטקטורה כאן מחליפה 75% משכבות הקשב הסטנדרטיות בשכבות מסוג gated DeltaNet, במבנה מחזורי שבו כל שלוש שכבות DeltaNet מלוות בשכבת קשב רגילה אחת. השינוי המבני הזה נועד לפתור את צוואר הבקבוק המוכר של זיכרון בהסקת טקסטים ארוכים, והנתונים מראים שיפור של 75% ביעילות הזיכרון וקצב הפלט לעומת ארכיטקטורה רגילה באורך דומה.

במבחני ביצועים מול דגמים מקבילים באותו סדר גודל, התוצאות מציבות אותו באמצע הטבלה. הוא משיג 49.0 במבחן HumanEval וציון של 55.1 במתמטיקה, מה שמציב אותו ביתרון קל על פני דגם הבסיס Olmo 3 7B, אך הוא נשאר מאחורי דגמים כמו Qwen-2.5-7B שמגיעים ל־66.1 בקוד.

מתאים ל

  • עיבוד מסמכים ארוכים באנגלית

    חלון ההקשר מגיע ל־65,536 טוקנים, ושכבות ה־RNN ההיברידיות חוסכות 75% ממשאבי הזיכרון בריצה.

  • בסיס לאימון מודלים פנימיים

    הארכיטקטורה משלבת יעילות הסקה טובה, ויש נקודות ביקורת זמינות שמקלות על כוונון ייעודי.

  • מחקר ארכיטקטורות קשב חלופיות

    הקוד וההגדרות פתוחים לגמרי כדי לבדוק שילוב של DeltaNet עם שכבות Transformer בעבודה שוטפת.

איפה זה נופל

המודל אומן על אנגלית בלבד, ואין לו שום התאמה מתועדת לשפות אחרות. טקסטים בעברית צפויים להניב תוצאות שבורות, חוסר הבנה והזיות מרובות. מעבר לכך, מדובר במודל בסיס נטול שכבות הגנה, סינון או כוונון עדין, והוא מייצר טעויות עובדתיות או פלטים רעילים בהיעדר הנחיות מתאימות.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

החומרים מצהירים על אנגלית בלבד כשפת האימון. אין לצפות ממנו להבין פניות בעברית או לייצר תשובות מדויקות בלי לעבור אימון מקיף נוסף.

האם אפשר להשתמש בו ישירות כעוזר אישי או צ'אטבוט?

לא מומלץ. מדובר במודל בסיס שמיועד להשלמת טקסט, ולא במודל שעבר אימון להוראות, ולכן עדיף לקחת את גרסאות ה־Instruct או ה־Think של אותה סדרה.

במה שונה גרסת ה־Hybrid מגרסת Olmo 3 הרגילה?

הגרסה ההיברידית מחליפה את רוב שכבות הקשב ב־DeltaNet. השינוי הזה מעניק שיפור של 75% בניצול הזיכרון בהקשרים ארוכים, לצד שיפור מסוים בציוני המדידה.

איך מריצים

המשקל הגולמי של הקבצים עומד על 13.9 ג'יגה בייט, כך שבדיוק מלא של 16 ביט דרוש כרטיס מסך עם לפחות 16 עד 24 ג'יגה זיכרון כדי לטעון אותו ולהשאיר מקום להקשר עבודה סביר. הספריות דורשות transformers בגרסה 5.3.0 ומעלה, ואפשר לכווץ אותו ל־8 ביט בעזרת bitsandbytes כדי להסתפק בחומרה צנועה יותר.

הגרסה הזו היא מודל בסיס לא מכויל, ללא התאמת שיחה או הנחיות. אם המטרה שלכם היא לקבל תשובות ישירות בצ'אט בלי לאמן או לכוונן אותו מראש, חבל על החשמל והמשאבים שלכם, ועדיף לפנות לגרסאות ה־Instruct או להשתמש במודל מוכן דרך ספק ענן חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/Olmo-Hybrid-7B")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 13.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 סטנדרטי, מה שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי הקוד והפצה של המוצר. המכון הוסיף הנחיות לשימוש אחראי, אך מבחינה משפטית הרישיון הוא קוד פתוח מתירני שמחייב בעיקר שמירה על הצהרת זכויות היוצרים של המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗