GPT
O

Ouro-2.6B-Thinking

קוד פתוח

ByteDanceapache-2.02025-10-28

  • transformers
  • safetensors
  • ouro
  • text-generation
  • looped-language-model

מודל קומפקטי שמכוון לחשיבה מתמטית ומדעית מורכבת. הוא מריץ חישוב חוזר בשכבות כדי להגיע לרמת ביצועים של מודלים גדולים יותר בלי לנפח את הזיכרון.

  • 2.7Bפרמטרים
  • 65,536טוקנים בהקשר
  • 5.0 GBמשקל הקבצים
  • 17,117הורדות בחודש

מה זה

הארכיטקטורה של המודל הזה מתבססת על מנגנון ריצה מעגלי עם צעדים חוזרים, מה שמאפשר לו להעמיק את החישוב בלי להגדיל את כמות הפרמטרים מעבר ל־2.7 מיליארד. הוא אומן מראש על 7.7 טריליון טוקנים, ואז עבר כוונון ייעודי על 8.3 מיליון דוגמאות שמתמקדות במתמטיקה, קוד ומדעים. הרעיון הוא פשוט, במקום להוסיף משקלים, נותנים לשכבות הקיימות לעבד את המידע שוב ושוב.

בפועל אתם מקבלים פלט שמציג תהליך חשיבה מפורט לפני התשובה הסופית. המפתחים שלו טוענים לתחרות מול מודלים של 4 מיליארד פרמטרים, אבל היתרון האמיתי כאן הוא הגמישות החישובית. אפשר לקבוע מראש כמה צעדים חוזרים להריץ או להגדיר סף יציאה מוקדמת כדי לחסוך זמן ריצה על שאלות קלות.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא עבר אימון על 3.5 מיליון דוגמאות מתמטיות ויודע לפרק שלבי חישוב.

  • הסקה מדעית במכשיר קצה

    משקל של חמישה ג'יגה מאפשר להריץ משימות חשיבה מורכבות על חומרה מקומית צנועה.

  • ניתוח ויצירת קוד בסיסי

    אומן על 3.2 מיליון דוגמאות קוד ומסוגל להסביר את ההיגיון מאחורי המימוש.

איפה זה נופל

היוצרים מגדירים את המודל למטרות מחקר בלבד ומספקים אותו ללא אחריות לסביבות ייצור. בנוסף, חלון ההקשר באימון הכוונון הוגבל ל־32 אלף טוקנים למרות שהארכיטקטורה מוגדרת עד 65 אלף, כך שהתנהגות בטקסטים ארוכים במיוחד עלולה לזייף. תלות הגרסה בספריית transformers הישנה יוצרת כאב ראש תחזוקתי בפרויקטים מודרניים.

אותה משפחה

Ouro יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

ערכת הנתונים המוצהרת מתרכזת במתמטיקה, קוד ומדעים באנגלית, ללא ציון אימון בעברית. אפשר לצפות שהוא יבין פקודות פשוטות, אבל לניתוח טקסט עברי עמוק עדיף לבדוק אותו מראש או לבחור מודל אחר.

מה המשמעות של צעדים חוזרים בהגדרות המודל?

הפרמטר total_ut_steps קובע כמה פעמים השכבות יחשבו מחדש על המידע. ארבעה צעדים נותנים את הדיוק המרבי, אך הורדה לשלושה או שניים תקצר את זמן ההסקה על חשבון איכות הפתרון.

למה יש אזהרה על גרסת ספריית transformers?

הארכיטקטורה מכילה מימוש שכבות ייחודי שנתקל בבעיות תאימות ומטמון בגרסאות 4.56.0 ומעלה. כדי שהוא ייטען וירוץ באופן יציב, יש להגדיר בסביבת העבודה transformers==4.54.1 בדיוק.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.0 ג'יגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 8 עד 12 ג'יגה זיכרון מריץ אותו מקומית בלי שום בעיה. הטעינה נעשית דרך ספריית transformers הרגילה עם AutoModelForCausalLM, אך חובה לקבע את גרסת הספרייה ל־4.54.1 כדי למנוע בעיות תאימות.

אם אתם מתכננים לפרוס אותו במנועי הסקה כמו vLLM, קחו בחשבון שמנגנון היציאה המוקדמת לא נתמך שם כרגע. המודל ייאלץ לרוץ בכל ארבעת הצעדים החוזרים שלו תמיד, מה שמבטל את החיסכון בזמן על משימות פשוטות.

from transformers import pipeline

pipe = pipeline("text-generation", model="ByteDance/Ouro-2.6B-Thinking")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית. עם זאת, היוצרים הוסיפו הבהרה בולטת שהמודל מיועד לצורכי מחקר בלבד ומסופק כמות שהוא, כך ששימוש במוצר חי דורש בדיקות עצמאיות ולקיחת סיכון על איכות הפלט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗