GPT
Q

Qwopus-GLM-18B-Merged-GGUF

קוד פתוח

KyleHessling1apache-2.02026-04-17

  • gguf
  • merge
  • frankenmerge
  • qwen3.5
  • reasoning

שני מודלים מבוססי Qwen של 9 מיליארד פרמטרים חוברו כאן לשכבות כפולות עם אימון תיקון קצר. התוצאה נותנת יכולות תכנות וסוכנים חזקות שנכנסות לכרטיסי מסך ביתיים בלי לדרוש משאבים כבדים.

  • 55.1 GBמשקל הקבצים
  • 318,097הורדות בחודש
  • 117לייקים

מה זה

מי שיצר את הדבר הזה לקח שני כיוונונים שונים של Qwen3.5-9B, ערם את 32 השכבות של כל אחד מהם למבנה של 64 שכבות, והעביר אותם אימון QLoRA של 1000 צעדים כדי לחבר את התפר ביניהם. החיבור הזה משלב מודל אחד שחזק בהסקה ובסוכנים יחד עם מודל שעבר זיכוך מנתוני GLM לפירוק בעיות מורכבות.

במבחני הביצועים הוא הוציא תוצאה של 40 מתוך 44, שזה 90.9 אחוזים, ועקף שם את Qwen 3.6 MoE שתופס יותר מכפול זיכרון. היתרון המרכזי שרואים במבחנים הוא יצירת קוד צד לקוח שלם, כולל HTML, CSS וסקריפטים אינטראקטיביים של אלפי תווים בלי לשבור סוגריים, לצד תוצאה מושלמת בשימוש בכלים.

מתאים ל

  • יצירת ממשקי ווב מקומית

    הוא מייצר אלפי תווי HTML ו־CSS מורכבים עם סוגריים מאוזנים וסקריפטים עובדים ישירות מהמחשב שלכם.

  • הרצת סוכנים ותהליכי כלים

    הוא עבר את כל מבחני הקריאה לכלים ותכנון רב שלבי, ומתאים לחיבור מול סקריפטים מקומיים.

  • פתרון בעיות אלגוריתמיות

    השילוב של שכבות ההסקה מסייע בפירוק בעיות חישוביות, כמו מעבר על חלונות נעים בקוד פייתון.

איפה זה נופל

זה עדיין פרויקט ניסיוני שמבוסס על הדבקת שכבות, והתפר עדיין משאיר סימנים. במבחני התכנות שלושה מבחנים עדיין נכשלו, כולל טעויות במתן שמות לפונקציות, סוגר חסר ב־JavaScript ואי יצירת בלוק קוד מתאים לבדיקות pytest.

מעבר לזה, רשימת השפות הרשמית כוללת אנגלית, סינית, קוריאנית, יפנית, צרפתית, גרמנית וספרדית בלבד. עברית לא נכללת בשפות המטרה שלו, כך שלא הייתי בונה עליו לעיבוד שפה מקומית לפני שבודקים בפועל איך הוא מתמודד איתה.

שאלות
נפוצות

האם המודל תומך בעברית בצורה אמינה?

המודל מאומן ומכוונן בעיקר לאנגלית, סינית ושפות אירופיות מרכזיות, ועברית אינה מופיעה ברשימת השפות שלו. הוא עשוי לייצר טקסט בסיסי הודות לבסיס של Qwen, אך הוא אינו מיועד למשימות כתיבה מורכבות בעברית.

איך הגרסה הזו מתמודדת עם בעיות העימוד בקוד שהיו במקור?

באיחוד השכבות המקורי היו תקלות של שבירת סוגריים ובלוקי קוד פגומים. היוצר העביר אותו אימון תיקון של 1000 צעדים שפתר את רוב הבעיות האלו, אם כי נשארו באגים נקודתיים בפורמט בחלק קטן ממבחני התכנות.

האם אפשר להריץ אותו על מעבד רגיל בלי כרטיס מסך ייעודי?

אפשר לטעון קובץ GGUF של 9.2 גיגה בייט לזיכרון המחשב דרך llama.cpp, אבל קצב הייצור יהיה אטי משמעותית מ־66 הטוקנים לשנייה שנמדדו על כרטיס מסך. מומלץ כרטיס עם לפחות 12 גיגה זיכרון פנימי.

איך מריצים

הקובץ המרכזי כאן שוקל 9.2 גיגה בייט בקוונטיזציה של Q4_K_M, מה שאומר שכרטיס מסך ביתי עם 12 או 16 גיגה זיכרון, כמו RTX 3060 או 4070, יריץ אותו במלואו ישירות מהזיכרון הגרפי. ההרצה נעשית דרך llama.cpp או llama-server עם תמיכה ב־Flash Attention ותבנית שיחה מתאימה.

קצב העבודה עומד על סביב 66 טוקנים לשנייה, שזה יציב ומספיק לפיתוח מקומי. אם אתם צריכים רק שאילתה פשוטה פה ושם ולא מריצים סוכנים בלולאות מקומיות, עדיף לפנות ל־API חיצוני במקום לבזבז זמן על הגדרת סביבה ותפיסת כרטיס המסך.

ollama run hf.co/KyleHessling1/Qwopus-GLM-18B-Merged-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗