GPT
D

DeepSWE-Preview

קוד פתוח

agentica-orgmit2025-07-01

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

מודל קוד של 33 מיליארד פרמטרים שאומן בלמידת חיזוק בלבד כדי לפתור תקלות בריפוזיטוריים שלמים. מתאים למי שרוצה ביצועים ברמה הגבוהה ביותר בעולם הקוד הפתוח בלי תלות במודלים מסחריים סגורים.

  • 33Bפרמטרים
  • 40,960טוקנים בהקשר
  • 122 GBמשקל הקבצים
  • 1,453הורדות בחודש

מה זה

במקום אימון רגיל על טקסטים קיימים, המודל הזה אומן ישירות מול סביבת פיתוח אמיתית של R2EGym בעזרת למידת חיזוק בלבד מעל Qwen3-32B עם מנגנון חשיבה פעיל. הוא מקבל סביבת עבודה, קורא קבצים, מריץ פקודות בשורת הפקודה, עורך קוד ובודק אם הטסטים עוברים לפני שהוא מגיש פתרון. בבנצ'מרק של SWE-Bench-Verified המודל פותר 42.2 אחוז מהמשימות בניסיון בודד, ומזנק ל־59 אחוז כשמפעילים דגימה מרובה עם מנגנון אימות. התוצאה הזו שמה אותו במקום הראשון בקטגוריית המודלים הפתוחים, מעל מתחרים ייעודיים כמו Skywork ו־OpenHands באותו סדרי גודל.

ההבדל המשמעותי נמצא באלגוריתם החיזוק שלו, שמתקן עיוותים באורך התשובות ומונע כניסה ללולאות של שגיאות יקרות. הוא תוכנן לעבוד כסוכן שמתקן באגים מקצה לקצה, ולא כמנוע שמציע השלמת שורה בתוך העורך.

מתאים ל

  • תיקון באגים אוטונומי

    יודע לנתח דיווחי שגיאה, למצוא את הקובץ המתאים, לבצע עריכה ולהריץ טסטים לבד.

  • סריקת מאגרי קוד גדולים

    מנווט בתיקיות ומריץ חיפושים כדי לזהות נקודות כשל במערכות מורכבות באנגלית.

  • תשתית לסוכני פיתוח

    משמש כבסיס פתוח למחקר ופיתוח כלים פנימיים בחברות בלי להסתמך על ספקי API סגורים.

איפה זה נופל

המודל מדבר באנגלית בלבד ולא מתאים לטיפול בתיעוד או קוד שנשען על עברית. בניסיון יחיד הוא עדיין נכשל ברוב המוחלט של הבעיות, עם מעל 57 אחוז שגיאה, כך שחייבים להריץ אותו עם מעטפת בדיקות חיצונית או דגימות מרובות כדי להתקרב למספרים המרשימים מהגרפים. בנוסף, הוא מוגדר כגרסת תצוגה מקדימה, מה שאומר שסביר להניח שיש פינות לא יציבות בהתנהגות הכלים שלו.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

החומר הרשמי מגדיר אנגלית כשפה הנתמכת היחידה. לא הייתי מנסה לבקש ממנו לקרוא או לכתוב פונקציות עם הערות ותיעוד בעברית כי הוא לא אומן לזה.

מה החומרה המינימלית להרצה שלו אצלי?

במצב המקורי של float32 הקבצים תופסים 122 גיגהבייט ודורשים מערך של שמונה כרטיסי מסך חזקים. עד שלא יצאו גרסאות קוונטיזציה של 4 או 8 ביט, עדיף להריץ אותו על שרת ייעודי בענן או דרך ממשק חיצוני.

איך מריצים

המשקל בפורמט float32 מגיע ל־122 גיגהבייט, מה שאומר שהרצה מקומית בתצורה המקורית דורשת שרת ייעודי כבד מאוד, כמו שמונה כרטיסי מסך עם מקביליות מלאה. ההמלצה של היוצרים היא להרים שרת vLLM גרסה 0.8.5 ומעלה עם הקשר מורחב של 65,536 טוקנים כדי לתת לו מקום לקרוא תיקיות שלמות ולחשוב.

אם אין לכם קלאסטר כזה במשרד, אפשר לחכות לגרסאות מכווצות או לצרוך אותו דרך תשתית ענן כמו Together AI שתומכת בו, במיוחד לאור העובדה שמדובר בממשק תואם OpenAI Chat Completions.

from transformers import pipeline

pipe = pipeline("text-generation", model="agentica-org/DeepSWE-Preview")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון MIT, שמאפשר שימוש מסחרי חופשי לחלוטין. אפשר לשנות את הקוד והמשקלים, להטמיע אותם במוצר פנימי או מסחרי, ולהפיץ הלאה ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗