GPT
S

SERA-32B

קוד פתוח

allenaiapache-2.02026-01-27

  • safetensors
  • qwen3

סוכן קוד בקוד פתוח שמביא ביצועים של מודלים ענקיים בגודל 33 מיליארד פרמטרים בלבד. הוא פותר חצי מבעיות התוכנה בבנצ'מרק הרשמי, בדיוק כמו מודלים ששוקלים פי שלושה.

  • 33Bפרמטרים
  • 40,960טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 186הורדות בחודש

מה זה

מכון אלן בנה את המודל הזה על בסיס Qwen 3-32B באמצעות זיקוק ידע ממודל ענק, GLM-4.6, על גבי 25 אלף מסלולי פתרון סינתטיים. הרעיון היה לייצר נתוני אימון מתוך 121 מאגרי קוד פייתון בלי להריץ טסטים בפועל, אלא על ידי השוואת שורות קוד בלבד. השיטה הזו חסכה עלויות אימון מסיביות והסתכמה בכאלפיים דולר בלבד.

במבחן SWE-bench Verified המודל הגיע לפתרון של 49.5 אחוז מהמשימות. זה מספר מעניין מאוד, כי מודל הבסיס שלו עמד על 24.4 אחוז בלבד, והתוצאה הזו שמה אותו ראש בראש מול GLM-4.5-Air שגדול ממנו פי שלושה ומחזיק בתוצאה של 50.5 אחוז. בפועל, מדובר בסוכן שיודע לנווט בריפו, לקרוא באגים, לבצע שינויים ולתקן שגיאות ברמה שמצפים לה מכלים מסחריים כבדים.

מתאים ל

  • סוכן תיקון באגים בריפו

    הוא מגיע לתוצאה של 49.5 אחוז בבנצ'מרק פייתון, ולכן מתאים לטיפול ישיר ב־issues ובאגים בפרויקטים קיימים.

  • עבודה מול Claude Code

    הכלי הרשמי מספק חיבור ישיר ל־Claude Code ומאפשר להריץ סוכן מקומי או ענני במקום לשלם על טוקנים יקרים.

  • אימון סוכן לארגון

    היוצרים מציעים את שיטת האימון הזו כדי לבצע התאמה אישית למאגר קוד פנימי בעלות של כ־1,300 דולר.

איפה זה נופל

המודל הזה נבדק אך ורק על מאגרי פייתון, ואין שום מידע לגבי היכולת שלו בשפות אחרות כמו טייפסקריפט או גו. מעבר לזה, בגלל אופי האימון על משימות SWE-bench, המודל מנסה לעיתים לקרוא לכלי בשם submit שלא קיים מחוץ לסביבת הבדיקות, כך שחייבים פרוקסי כמו ה־CLI שלו כדי לבלום את הקריאה הזו.

נקודה קריטית נוספת היא שאין כאן שום שכבת בטיחות. המודל שוחרר ככלי מחקרי נקי, כך שהוא עלול לייצר קוד עם פרצות אבטחה, כשלי הגנה או פגיעויות הזרקה. אי אפשר לתת לו לדחוף קוד לפרודקשן בלי בדיקה ידנית ומעבר קפדני של מתכנת.

אותה משפחה

SERA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס צרכני כמו RTX 4090?

לא במשקל המקורי שלו. המודל שוקל 61 גיגה בייט ודורש לפחות כרטיס אחד של 80 גיגה בייט כדי לרוץ עם חלון הקשר מלא. כדי להריץ על כרטיסים ביתיים תצטרכו להמתין לקוונטיזציה כמו AWQ או GPTQ שחותכת את צריכת הזיכרון.

איך המודל מתמודד עם שפות תכנות שהן לא פייתון?

הנתונים בכרטיס המודל מבוססים על 121 מאגרי קוד בפייתון בלבד, וכל הבדיקות נעשו בסביבה זו. היוצרים מצהירים בפירוש שהביצועים שלו בשפות אחרות אינם ידועים, ולכן לא מומלץ להסתמך עליו לפרויקטים שאינם פייתון בלי בדיקה מוקדמת.

איך מריצים

המשקל הגולמי של הקבצים מגיע ל־61 גיגה בייט, מה שאומר שכדי להריץ אותו בהקשר מלא של 32 אלף טוקנים בלי קוונטיזציה תצטרכו כרטיס בודד של 80 גיגה בייט כמו A100 או H100. אפשרות נוספת שהיוצרים מציעים בהגדרות ההרצה היא חלוקה לארבעה כרטיסים באמצעות vLLM.

אם אין לכם קלאסטר כזה בחצר, היוצרים שחררו כלי שורת פקודה בשם sera-cli שמתחבר ישירות לסביבת Modal, שבה השרת עולה תוך כעשר דקות בהרצה ראשונה, או לכל נקודת קצה קיימת, כולל אינטגרציה לעבודה מול Claude Code. למי שרוצה רק לבדוק תאימות לקוד שלו בלי לשלם על שרת ייעודי חודשי, פריסה לפי דרישה ב־Modal עדיפה בהרבה מלהחזיק חומרה מקומית.

pip install -U huggingface_hub
hf download allenai/SERA-32B

הרישיון

הרישיון הוא Apache 2.0 מלא, מה שמתיר שימוש מסחרי, שינוי של הקוד והפצה חופשית לכל מטרה. עם זאת, היוצרים מציינים שהשימוש כפוף גם לקווי ההנחיה של מכון אלן לשימוש אחראי, שמבקשים בדיקה ידנית של פלטים והימנעות מיצירת קוד זדוני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗