GPT
Q

Jackrong/Qwopus-GLM-18B-Merged-GGUF

קוד פתוח

Jackrongapache-2.02026-04-18

  • gguf
  • merge
  • frankenmerge
  • qwen3.5
  • reasoning

שילוב שכבות מודבק של שני מודלי 9B שעבר אימון תיקון קצר כדי לייצר פתרון של 18B. הוא נכנס לכרטיסי מסך ביתיים ומיועד למי שמחפש יכולות תכנות וסוכנים בלי לצרוך זיכרון של מודל ענק.

  • 47.6 GBמשקל הקבצים
  • 8,700הורדות בחודש
  • 275לייקים

מה זה

מדובר בהדבקה של 64 שכבות משני מודלים שונים של Jackrong, שניהם מבוססים על Qwen3.5-9B. החצי הראשון מגיע ממודל שחודד להסקה בסגנון Opus, והחצי השני מגיע מזיקוק של מודל GLM-5.1. כדי שהחיבור בין השכבות לא ישבור את הטקסט, העבירו אותו אימון LoRA של 1,000 צעדים שפתר בעיות מבניות קשות בפלט.

בבדיקה של 44 מבחנים הכוללים תכנות, שימוש בכלים והסקה רב שלבית, הוא השיג 40 מתוך 44 הצלחות. בכרטיס המודל מציגים ציון של 90.9 אחוזים, שלטענתם עוקף את מודל ה־MoE של Qwen בגודל 35B בקטגוריות שנבדקו, תוך שימוש בפחות מחצי מכמות הזיכרון הגרפי.

מתאים ל

  • ייצור קוד צד לקוח

    עבר בהצלחה מבחני דפי אינטרנט שלמים עם HTML, CSS ו־JavaScript תקינים ללא שגיאות סוגריים.

  • סוכנים וקריאות לכלים

    קיבל ציון מושלם במבחני הפעלת כלים ותכנון רב שלבי, ומתאים לחיבור לפונקציות מקומיות.

  • פיתוח מקומי ב־12GB VRAM

    מאפשר הרצה של מודל תכנות והסקה מעבר לגודל 9B על כרטיסי מסך ביתיים רגילים.

איפה זה נופל

זהו עדיין ניסוי קהילתי ולא מודל שעבר בדיקות בטיחות מקיפות. למרות אימון התיקון, שלושה מבחני תכנות עדיין נכשלו בגלל בעיות עימוד: שגיאה במתן שם לפונקציה, סוגר חסר ב־JavaScript ואי יצירת בלוק קוד עבור בדיקות pytest. בנוסף, רשימת השפות הרשמית אינה כוללת עברית אלא רק אנגלית, סינית, קוריאנית, יפנית, צרפתית, גרמנית וספרדית.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מפרט שפות נתמכות הכוללות אנגלית, סינית, שפות מזרח אסיה ואירופה, ועברית אינה מופיעה ביניהן. ייתכן שהוא יבין מילים בודדות כחלק מהאימון של מודל הבסיס, אבל הוא לא מיועד לשימוש שוטף בעברית.

למה להעדיף אותו על פני מודל 9B רגיל?

השילוב בין שתי גרסאות ההסקה יצר מודל שפותר בעיות תכנות מורכבות יותר מגרסת המקור של 9B. הוא מיועד למי שיש לו כרטיס עם 12 גיגה בייט ורוצה למצות את החומרה מעבר למה ש־9B מאפשר בלי לקפוץ למודלי 27B.

איך מריצים

הקובץ המרכזי שמופץ הוא בפורמט GGUF ובדחיסת Q4_K_M, ושוקל 9.2 גיגה בייט. בשביל להריץ אותו עם llama.cpp נדרש כרטיס מסך צרכני של 12 עד 16 גיגה בייט זיכרון, למשל RTX 3060 או 4070. קצב הייצור שנמדד עומד על כ־66 טוקנים לשנייה.

אם יש לכם כרטיס חלש יותר או שאתם צריכים לפתוח את חלון ההקשר המלא של 262,144 טוקנים, הזיכרון הגרפי לא יספיק. במקרים כאלה עדיף לשלם על API של מודל מסחרי ולא לנסות לדחוף אותו למחשב מקומי.

ollama run hf.co/Jackrong/Qwopus-GLM-18B-Merged-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. מי שמשלב אותו במוצר יכול לעשות זאת בחופשיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗