GPT
O

Ouro-2.6B

קוד פתוח

ByteDanceapache-2.02025-10-28

  • transformers
  • safetensors
  • ouro
  • text-generation
  • looped-language-model

מודל שפה קומפקטי של בייטדאנס שמריץ שכבות בלולאה חוזרת במקום להוסיף משקל. הוא נותן ביצועים של מודלים גדולים יותר בלי לתפוס זיכרון כרטיס מיותר.

  • 2.7Bפרמטרים
  • 65,536טוקנים בהקשר
  • 5.0 GBמשקל הקבצים
  • 10,822הורדות בחודש

מה זה

במקום לתפוח לגדלים של שבעה מיליארד פרמטרים ומעלה, המודל הזה מחזיק 2.6 מיליארד פרמטרים ומשתמש בחישוב רקורסיבי. הוא מעביר את המידע דרך אותן שכבות משותפות ארבע פעמים ברצף, מה שמאפשר לו לדמות תהליך חשיבה עמוק יותר במרחב הנסתר בלי לנפח את נפח האחסון בזיכרון הגרפי. היוצרים טוענים שהוא מגיע לרמה של מודלים סטנדרטיים בגודל 3 עד 4 מיליארד פרמטרים.

הוא אומן על מאגר עצום של 7.7 טריליון טוקנים שכלל קוד, מתמטיקה, טקסט רשת ומסמכים ארוכים. המבנה שלו מציע גמישות מעניינת: אפשר לשלוט ידנית במספר החזרות או להפעיל מנגנון יציאה מוקדמת שמקצר את זמן הריצה בטוקנים פשוטים, מה שנותן שליטה טובה על פשרת המהירות מול הדיוק.

מתאים ל

  • מחקר על מודלים רקורסיביים

    מאפשר בדיקה של ארכיטקטורות לולאה ויציאה מוקדמת על חומרה צנועה, בלי צורך בשרתים כבדים.

  • עיבוד טקסט ארוך מקומי

    תומך בחלון הקשר נרחב של עד 64K טוקנים במודל קל משקל שרץ על כרטיס מסך בודד.

  • בדיקת הסקה הדרגתית

    מאפשר לשנות את כמות צעדי החישוב בזמן ריצה כדי למדוד את הפער בין מהירות לאיכות התוצאה.

איפה זה נופל

היוצרים מזהירים במפורש שהמודל מיועד למחקר בלבד ומסופק ללא אחריות לסביבות ייצור. בנוסף, למרות שחלון ההקשר מוגדר עד 64 אלף טוקנים, האימון הבסיסי נעשה על 4 אלף בלבד וההרחבה נעשתה בשלבי אימון מאוחרים, כך שצריך לבדוק טוב את איכות השליפה באורכים כאלה לפני שבונים עליה. עברית בכלל לא מוזכרת בדאטה שלו, מה שאומר שסביר מאוד שהיא חלשה בהרבה מאנגלית או קוד.

אותה משפחה

Ouro יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מתאים לשרת מהיר עם vLLM?

אפשר להריץ אותו, אבל vLLM לא תומך במנגנון היציאה המוקדמת. זה אומר שהמודל יבצע תמיד את כל ארבעת צעדי החישוב, ותאבדו חלק מיתרון הגמישות והחיסכון בזמן.

איזו גרסת transformers צריך להתקין?

החוקרים ממליצים להשתמש בגרסה 4.54.1 או גרסאות ישנות יותר מ־4.56.0. גרסאות חדשות יותר סובלות מבעיות תאימות ומצריכות טלאים מיוחדים לניהול ה־KV cache כדי לעבוד בלי שגיאות.

איך מריצים

המשקל הכולל של הקבצים עומד על חמישה גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 8 או 12 גיגה בייט של VRAM מספיק כדי להעלות אותו במלואו דרך ספריית transformers. אין צורך בשרתים מורכבים או במערכים של כמה כרטיסים כדי להתחיל לשחק איתו.

העסק מסתבך אם בונים על סביבות הסקה מהירות כמו vLLM. המערכת הזו לא תומכת במנגנון היציאה המוקדמת, ולכן המודל ייאלץ לחשב את כל ארבעת הצעדים בכל טוקן ללא פשרות. בנוסף, יש תלות קשיחה בגרסאות transformers ישנות, סביב 4.54.1, עקב בעיות תאימות עם המבנה הפנימי של מנהל הזיכרון.

from transformers import pipeline

pipe = pipeline("text-generation", model="ByteDance/Ouro-2.6B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא, מה שמתיר שימוש מסחרי, שינוי קוד והפצה חופשית לכל מטרה. עם זאת, האזהרה של החברה שהמודל מיועד לצורכי מחקר בלבד אומרת שכל תקלה, הזיה או קריסה בסביבת אמת היא על אחריותכם הבלעדית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗