GPT
Q

Qwable-v1

קוד פתוח

lordx64agpl-3.02026-06-14

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • qwen

שילוב של בסיס Qwen עם זיקוק כפול של הסקת מסקנות ושימוש בכלים בסגנון קלוד. מתאים למי שרוצה סוכן תכנות בקוד פתוח שפולט פעולות כתיבה והרצה במבנה XML מוגדר.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 67.0 GBמשקל הקבצים
  • 265הורדות בחודש

מה זה

הארכיטקטורה בנויה כמודל מומחים של 36 מיליארד פרמטרים, אבל בזמן ריצה מופעלים רק 3 מיליארד, מה שחוסך משאבים בלי לוותר על עומק. התהליך כלל שרשור של שני אימונים: קודם זיקוק חשיבה מבוסס Opus 4.7, ועליו שכבת אימון נוספת של שימוש בכלים מתוך עקבות של Fable-5. התוצאה היא מודל שמייצר בלוק חשיבה מפורט ואז פולט קריאות לפעולות כמו עריכת קבצים והרצת פקודות shell.

בניגוד למודלי בסיס שפולטים קוד כטקסט חופשי, כאן הפלט נבנה לפעולה ישירה בתוך סביבת פיתוח אוטונומית. כרגע אין תוצאות מדידה רשמיות בלוח המבחנים כי המפתחים השאירו את הציונים ריקים עד לאימות מלא, כך שאי אפשר להסתמך על מספרים יבשים לגבי ביצועי התכנות שלו ביחס למתחרים.

מתאים ל

  • סוכן תכנות אוטונומי

    פולט בלוקים של קריאות לעריכת קבצים ופקודות מעטפת שמתאימים ישירות לסביבת הרצה.

  • חשיבה ופתרון בעיות

    משלב בלוקי חשיבה פנימיים שמפרקים את הבעיה לפני מתן התשובה בזכות הזיקוק מ־Opus.

  • פיתוח שרתי ווב ומשחקים

    דאטה־סט האימון התמקד ישירות בקוד Express, סקריפטים ורכיבי Three.js.

איפה זה נופל

השימוש בכלים אינו טבעי בכל מצב ותלוי לחלוטין בהנחיית מערכת ייעודית. בלי פרומפט מערכת מפורש שדורש XML, הוא נופל בחזרה לדפוס של הסברים בבלוקי מרקדאון רגילים. בנוסף, שמות הכלים שהוא מייצר לא תמיד תואמים לשמות המקוריים של קלוד, והוא ממציא שמות חלופיים שמחייבים מיפוי ידני בקוד שלכם.

נתוני האימון לסוכן צרים מאוד ומבוססים על היסטוריית עבודה של מפתח בודד, בעיקר סביב פיתוח ווב ומשחקים. במשימות דבאופס, אבטחת מידע או עיבוד נתונים הוא עלול לפספס. יש גם סכנה לסחף אישיות שבו הוא מסרב לבקשות תמימות או מזדהה כקלוד.

אותה משפחה

Qwable יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה המודל לא מוציא קריאות לכלים אלא רק כותב הסבר?

הוא פולט תגיות XML רק אם מגדירים לו במפורש בפרומפט המערכת לפעול כסוכן ולהשתמש בפורמט הזה, או אם מזינים לו תוצאת כלי קודמת בשיחה. ללא הנחיה כזו, הוא פועל כמודל שיחה רגיל ומחזיר טקסט וקוד במרקדאון.

האם אפשר להשתמש במודל הזה ישירות בממשק הכלים של vLLM?

לא באופן ישיר. המודל אומן על מעטפת XML ייעודית ולא על מבנה ה־JSON המובנה של Qwen. תצטרכו להוסיף סקריפט שעושה פרסינג לטקסט עם ביטוי רגולרי וממיר את התגיות למבנה שהמערכת שלכם מצפה לקבל.

איך מריצים

משקלי ה־bf16 המלאים שוקלים כ־70 גיגהבייט ודורשים שני כרטיסי A100 של 80 גיגהבייט או H200 בודד, למשל בהרצה דרך vLLM עם פרלליזם של שני כרטיסים. אם יש לכם כרטיס ביתי יחיד של 24 גיגהבייט כמו 3090 או 4090, עדיף להוריד את גרסת ה־GGUF בכיול IQ4_XS ששוקלת כ־18 גיגהבייט. למי שמשתמש בתחנת עבודה עם 32 עד 48 גיגהבייט זיכרון גרפי, גרסת Q5_K_M במשקל 25 גיגהבייט תיתן איכות טובה יותר.

הקריאה ל־API של מודל מסחרי עדיפה אם אין לכם שרת ייעודי שפועל תמיד, או אם אתם לא רוצים לבנות שכבת תוכנה שמפרסרת תגיות XML מותאמות אישית.

from transformers import pipeline

pipe = pipeline("text-generation", model="lordx64/Qwable-v1")
print(pipe("שלום"))

הרישיון

הרישיון הוא AGPL-3.0 בגלל מערך הנתונים שעליו אומן. אם אתם מריצים אותו כשירות רשת שהמשתמשים ניגשים אליו דרך האינטרנט, אתם מחויבים לחשוף את קוד המקור המלא של המערכת כולה תחת אותו רישיון. לחברות שרוצות מוצר סגור או קוד מוגן, זו מגבלה משפטית קשה. בנוסף, המודל מתבסס על פלטים של Fable-5 שהושעה, ויש לבדוק את תנאי השימוש של אנתרופיק.

הרישיון המלא בעמוד המודל ↗