GPT
S

Seed-OSS-36B-Instruct

קוד פתוח

ByteDance-Seedapache-2.02025-08-20

  • transformers
  • safetensors
  • seed_oss
  • text-generation
  • vllm

מודל קוד פתוח של בייטדאנס עם חלון ענק של 512K ושליטה באורך החשיבה. מתאים למי שצריך ביצועים גבוהים בקוד ובסוכנים בלי לשלם על מודלי ענק.

  • 36Bפרמטרים
  • 524,288טוקנים בהקשר
  • 67.3 GBמשקל הקבצים
  • 45,727הורדות בחודש

מה זה

בייטדאנס שחררה מודל של 36 מיליארד פרמטרים שאומן על 12 טריליון טוקנים, עם תמיכה מובנית בחלון הקשר של 524,288 טוקנים. המאפיין הבולט בו הוא היכולת להגדיר תקציב חשיבה מראש, כפולות של 512 טוקנים, כשהמודל עוצר לבדוק כמה נשאר לו תוך כדי יצירת התשובה ומקצר או מאריך את שרשרת ההיגיון בהתאם.

במבחני ביצועים הוא עוקף מודלים פתוחים מקבילים בגודל שלו כמו סדרת Qwen3 וגמא 27B במשימות תכנות עם ציון של 67.4 ב־LiveCodeBench. במשימות סוכנים כמו SWE-Bench ופתרון בעיות בסביבות קמעונאות וטיסות הוא רושם יתרון ברור על פני המתחרים הפתוחים, אך במבחני מתמטיקה מורכבים כמו AIME הוא נשאר מעט מאחורי מודלים קנייניים או מתמחים.

מתאים ל

  • סוכני תכנות אוטונומיים

    משיג תוצאה של 67.4 ב־LiveCodeBench ומוביל במבחני SWE-Bench לפיתוח תוכנה עצמאי.

  • ניתוח מסמכי ענק

    תומך בחלון טבעי של חצי מיליון טוקנים לעיבוד בסיסי קוד או קובצי תיעוד שלמים.

  • סביבות אוטומציה מבוססות כלים

    מציג 70.4 במבחן TAU1-Retail ומיועד ישירות לעבודה עם קריאות לכלים.

איפה זה נופל

המודל פחות מבריק בשאלות ידע ישיר קצרות, עם ציון נמוך של 9.7 ב־SimpleQA וציון של 85.8 בלבד בציות להוראות מדויקות ב־IFEval, שבו מודלים אחרים בקטגוריה עוקפים אותו. בנוסף, הכרטיס לא מציין תמיכה בעברית ומצהיר על אופטימיזציה לשימוש בינלאומי בלבד, כך שיש לבדוק היטב את איכות הפלט בעברית לפני חיבור למשתמשים מקומיים.

אותה משפחה

Seed-OSS יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך עובד תקציב החשיבה?

אפשר לשלוח ערך של טוקנים, מומלץ בכפולות של 512, שהמודל מקצה למחשבה לפני התשובה. במהלך הריצה המודל מדפיס תגיות ייעודיות שבהן הוא סופר כמה טוקנים נותרו לו ומסיים את ההסבר כשהתקציב נגמר. אם מגדירים אפס, הוא עונה ישירות בלי שלב מחשבה מקדים.

האם המודל ירוץ על כרטיס RTX 4090 ביתי?

המשקל הבסיסי של הקבצים דורש מעל 67GB של זיכרון וידאו, ולכן בדיוק המקורי הוא לא ייכנס בכרטיס ביתי יחיד. כדי להריץ אותו מקומית על כרטיס של 24GB תצטרכו להשתמש בקוונטיזציה של 4 ביט דרך הסקריפט שמסופק במאגר.

איך המודל מסתדר עם עברית?

בתיעוד הרשמי מצוין שהמודל עבר אופטימיזציה לתרחישים בינלאומיים והוא נבדק במבחן MMMLU הכללי, אך אין בו התייחסות ספציפית לשפה העברית. כדאי להריץ בדיקות איכות על טקסטים מקומיים כדי לראות אם אוצר המילים מתמודד איתם ביעילות.

איך מריצים

המשקל הגולמי בדיוק מלא מגיע ל־67.3 גיגה-בייט, כך שאי אפשר להריץ אותו על כרטיס בודד רגיל. בשביל להרים אותו ללא קוונטיזציה תצטרכו שרת עם מספר מאיצים, למשל שני כרטיסי 80GB, ובדוגמת השרת של vLLM המפתחים אף מגדירים חלוקה על פני 8 מאיצים.

אפשר לכווץ את הזיכרון באמצעות הרצה ב־4 ביט או 8 ביט שנתמכת ישירות בסקריפטים המצורפים. אם אתם לא מחזיקים בחומרה מתאימה ורוצים רק לבדוק שאילתות בודדות או לנצל את חצי מיליון הטוקנים שלו במלואם, עדיף להשתמש בנקודת קצה מנוהלת בענן שמשלמת לפי טוקנים במקום לתחזק שרת כבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="ByteDance-Seed/Seed-OSS-36B-Instruct")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא. הרישיון מתיר שימוש מסחרי, שינוי קוד והפצה פנימית או מסחרית במוצר, בלי תמלוגים, ובתנאי שמשאירים את הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗