GPT
S

Seed-OSS-36B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-08-24

  • transformers
  • gguf
  • vllm
  • unsloth
  • text-generation

גרסת GGUF למודל הוראות של ByteDance עם 36 מיליארד פרמטרים. הוא מציע חלון הקשר ענק של 512K ושליטה ישירה על אורך החשיבה הפנימית בזמן פתרון בעיות.

  • 547 GBמשקל הקבצים
  • 1,737הורדות בחודש
  • 42לייקים

מה זה

המודל פותח על ידי צוות Seed של ByteDance ואומן על 12 טריליון טוקנים, כאשר הדגש המרכזי הושם על תהליכי חשיבה, יכולות סוכן ושימוש בכלים. הייחוד שלו לעומת מודלים אחרים בגזרת ה־30 מיליארד פרמטרים הוא מנגנון תקציב חשיבה, שמאפשר להגדיר לו מראש כמה טוקנים להקדיש לחשיבה מקדימה בכפולות של 512, או לכבות אותה לגמרי כדי לחסוך בזמן ריצה.

במבחני ביצועים הוא מתברג בצמרת המודלים הפתוחים בגודל שלו. במבחן LiveCodeBench שמודד תכנות מעשי הוא מגיע לציון של 67.4, ובמשימות סוכן כמו TAU1-Retail מגיע ל־70.4. גם בתרחישי תיקון קוד של SWE-Bench Verified עם OpenHands הוא רושם 56, תוצאה גבוהה שמעידה על התאמה טובה למשימות פיתוח מורכבות.

מתאים ל

  • סוכני פיתוח ותיקון באגים

    התוצאה הגבוהה ב־SWE-Bench וב־LiveCodeBench הופכת אותו למועמד טוב לפתרון תקלות קוד אוטומטיות.

  • ניתוח מסמכים באורך חריג

    תמיכה מובנית בחלון הקשר של עד 512K מאפשרת הזנה של ספריות קוד שלמות או תיקים עבי כרס ישירות לפרומפט.

  • פתרון בעיות מתמטיות קשות

    שילוב של תוצאות גבוהות במבחני AIME עם אפשרות לתת למודל תקציב חשיבה ארוך לצורך חישובים מורכבים.

איפה זה נופל

במבחן IFEval שבודק ציות עיוור להנחיות ספציפיות המודל קיבל 85.8, ציון נמוך יותר ממתחרים כמו OAI-OSS-20B או Gemma3-27B. בנוסף, במבחן SimpleQA של שאלות ידע קצרות הוא משיג 9.7 בלבד, מה שמצביע על נטייה להזיות כשמבקשים ממנו עובדות יבשות. בכרטיס המודל אין שום התייחסות לביצועים בשפה העברית, אלא רק הצהרה כללית על אופטימיזציה לשימוש בינלאומי, ולכן נדרשת בדיקה יסודית של התנהגותו בעברית לפני חיבור למערכת אמיתית.

שאלות
נפוצות

האם חייבים להוריד את כל 547 הגיגה בייט?

לא. המאגר מכיל עשרות קבצים שמייצגים רמות דחיסה שונות בפורמט GGUF. אתם צריכים לבחור קובץ אחד בלבד שמתאים ליכולות הזיכרון של המחשב או השרת שלכם.

איך משפיע תקציב החשיבה על הביצועים בפועל?

הגדלת התקציב בכפולות של 512 טוקנים משפרת את הדיוק בבעיות מתמטיקה וקוד מורכבות. במשימות פשוטות שאינן דורשות תכנון מקדים, כדאי לקבוע את התקציב ל־0 כדי לקבל תשובה מידית ולחסוך זמן עיבוד.

איך מריצים

מדובר במאגר קבצי GGUF במשקל כולל של 547 גיגה בייט שמכיל קוונטיזציות שונות. בפועל לא מורידים הכל, אלא בוחרים קובץ בודד לפי הזיכרון הפנוי. מודל של 36 מיליארד פרמטרים בקוונטיזציה של 4 ביט ידרוש לפחות 24 גיגה בייט זיכרון וידאו בריצה מקומית, בעוד גרסאות 8 ביט ידרשו 40 גיגה בייט ומעלה.

ההרצה מתבצעת דרך כלים שתומכים ב־GGUF כמו llama.cpp, או בשרת ייעודי עם vLLM באמצעות הגדרות ה־chat template המצורפות. אם אין לכם מאיץ גרפי חזק ברמת A100 או כרטיס ביתי עם שפע זיכרון וידאו, זמני התגובה בחלונות הקשר ארוכים יהיו אטיים מאוד, ועדיף להשתמש ב־API מנוהל.

ollama run hf.co/unsloth/Seed-OSS-36B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗