GPT
O

Ouro-1.4B

קוד פתוח

ByteDanceapache-2.02025-10-28

  • transformers
  • safetensors
  • ouro
  • text-generation
  • looped-language-model

מודל קומפקטי שמבצע חישוב חוזר על אותם משקלים כדי להגיע לביצועים של מודלים כבדים בהרבה. הוא מאפשר לשלוט בזמן הריצה מול דיוק בלי להחליף קבצים.

  • 1.4Bפרמטרים
  • 65,536טוקנים בהקשר
  • 2.7 GBמשקל הקבצים
  • 26,792הורדות בחודש

מה זה

בייטדאנס בנו כאן מודל שמתבסס על ארכיטקטורת לולאה, LoopLM, עם 24 שכבות וארבעה צעדי חישוב חוזרים על אותם פרמטרים. במקום להגדיל את כמות המשקלים בזיכרון, הוא מריץ את המידע כמה פעמים דרך אותה רשת כדי לבצע חשיבה במרחב הנסתר. על פי המפתחים, השיטה הזו מאפשרת לו להגיע לביצועים שמקבילים למודלים סטנדרטיים של שלושה עד ארבעה מיליארד פרמטרים, כשהוא מחזיק 1.4 מיליארד פרמטרים בלבד.

הוא אומן על 7.7 טריליון טוקנים בארבעה שלבים שונים, שכללו אימון מקדים רחב, שלב ייבוש, אימון ייעודי להקשר ארוך ואימון ביניים עם נתוני קוד, מתמטיקה ומסמכים ארוכים. המבנה שלו תומך בהקשר של עד 65,536 טוקנים, למרות שבאימון הבסיסי הוא עבד על 4,000 טוקנים. היתרון הייחודי הוא האפשרות לשנות בקונפיגורציה את מספר צעדי הלולאה או להגדיר יציאה מוקדמת, וכך לחסוך כוח מחשוב כשהתשובה ברורה למודל.

מתאים ל

  • מחקר על מודלי לולאה

    הוא מספק ארכיטקטורה אמיתית לבדיקת מנגנוני חשיבה חוזרת ויציאה מוקדמת בלי להזדקק למשאבי ענק.

  • הרצה מקומית על מחשב אישי

    במשקל של 2.7 גיגה בלבד, הוא נכנס בקלות לכרטיסי מסך ביתיים ונותן ביצועים של מודלים כבדים יותר.

  • ניתוח טקסטים ארוכים במכשיר קצה

    תמיכה בחלון הקשר של 64K מאפשרת להזין מסמכים שלמים למודל קל משקל שאינו דורש שרת ענן.

איפה זה נופל

המגבלה הכי משמעותית היא האזהרה של בייטדאנס עצמם, שהמודל מיועד למטרות מחקר בלבד ומסופק ללא שום התחייבות לשימוש בסביבת ייצור. מעבר לזה, התלות בגרסת transformers ישנה מסבכת שילוב שלו בפרויקטים מודרניים. מנגנון החישוב החוזר אמנם חוסך זיכרון VRAM, אבל הוא דורש זמן עיבוד נוסף לכל טוקן, כך שהמהירות נמוכה יותר בהשוואה למודל רגיל באותו הגודל.

אותה משפחה

Ouro יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך אפשר לשלוט על מהירות התגובה מול הדיוק שלו?

בקובץ הקונפיגורציה אפשר לשנות את הפרמטר total_ut_steps מ־4 למספר נמוך יותר כדי לקצר את זמן החישוב, או להוריד את early_exit_threshold מ־1.0 כדי שהמודל יחליט בעצמו מתי לצאת מהלולאה מוקדם.

למה המודל לא רץ לי כמו שצריך עם ספריית transformers עדכנית?

קיימת בעיית תאימות במנגנון ה־KV cache בגרסאות 4.56.0 ומעלה. כדי שהוא יעבוד באופן תקין, חובה להתקין גרסה ישנה כמו 4.54.1 כפי שהמפתחים מציינים בהנחיות ההרצה.

איך מריצים

המודל תופס בסך הכול 2.7 גיגה בייט בקבצים ורץ בדיוק bfloat16, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יריץ אותו בלי בעיה מקומית דרך ספריית transformers. כדי להשתמש בו צריך לשים לב לתאימות גרסאות, כי המפתחים דורשים לעבוד עם גרסת transformers ישנה מ־4.56.0 וממליצים על 4.54.1 כדי למנוע תקלות ב־KV cache.

אם אתם מתכננים להריץ אותו דרך vLLM בשביל ביצועי שרת מהירים, מנגנון היציאה המוקדמת לא יעבוד שם כרגע, והמערכת תריץ תמיד את כל ארבעת צעדי הלולאה. להריץ אותו עצמאית זה זול ופשוט בזכות המשקל הקל, אבל אם אין לכם שרת ייעודי שפועל באופן קבוע, שימוש במודל מסחרי דרך API יהיה פשוט יותר מלתחזק סביבת פייתון ישנה.

from transformers import pipeline

pipe = pipeline("text-generation", model="ByteDance/Ouro-1.4B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש חופשי, שינוי קוד והפצה, כולל שימוש מסחרי, בתנאי ששומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון. עם זאת, בגלל שהמפתחים ציינו במפורש בעמוד שהמודל מיועד למחקר בלבד, הטמעה שלו במוצר מסחרי עלולה להתנגש עם כוונת המפרסם, למרות התנאים המתירניים של הרישיון עצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗