GPT
C

Carnice-V2-27b-GGUF

קוד פתוח

kai-osapache-2.02026-04-25

  • llama.cpp
  • gguf
  • qwen
  • qwen3.6
  • qwen3.5

גרסת כיול מקומית ל־Qwen3.6-27B שמכוונת להרצת סוכנים אוטונומיים בסגנון Hermes. היא נותנת ביצועי מעקב הוראות משופרים בגדלים שמתחילים מכרטיסי 16GB.

  • 129 GBמשקל הקבצים
  • 319,862הורדות בחודש
  • 109לייקים

מה זה

מדובר בייצוא GGUF של מיזוג SFT על בסיס Qwen3.6-27B, שמיועד לעבודה עם llama.cpp. המטרה כאן ברורה, לייצר עקבות חשיבה וקריאות לכלים עבור סוכנים, בלי לסחוב את כל המשקל של מודלים ענקיים.

לפי הבדיקות של מודל המקור, ההתאמה הזו העלתה את הדיוק ב־IFEval המחמיר מ־85% בבסיס ל־90%, ואת רמת ההוראות ל־93.3%. גם מדד ה־perplexity על טוקנים של תשובות ירד מ־1.835 ל־1.513. בפועל זה אומר פחות סטיות ממבנה הפלט שביקשתם והבנה טובה יותר של משימות מורכבות, אם כי המדידות האלו נעשו על גרסת ה־BF16 ולא בקוונטיזציות הנמוכות.

מתאים ל

  • סוכן מקומי לפתרון תקלות

    הרצה מקומית של תהליכי דיבאג וקריאות לכלים בסגנון Hermes על גבי חומרת 16GB עד 24GB.

  • מעקב מדויק אחרי פורמט

    משימות שדורשות ציות נוקשה למבנה טקסט או מענה להוראות מורכבות, בזכות שיפור של 93.3% ב־IFEval.

  • מערכות ללא חיבור רשת

    מתאים לשרתים סגורים שבהם חובה להריץ אוטונומיה מלאה בלי לפנות ל־API חיצוני.

איפה זה נופל

הבנצ'מרקים המדווחים מבוססים על מדגם קטן מאוד של עשרים דוגמאות ב־IFEval, וזה רחוק מלהיות מבחן מייצג ומקיף לעבודה יציבה. בנוסף, כל התוצאות נמדדו על מודל המקור ולא על קובצי ה־GGUF המכווצים. מי שבוחר בגרסאות ה־2 ביט כדי לדחוס אותו לכרטיס 16GB ירגיש ירידה מורגשת באיכות, וקונטקסט ארוך פשוט לא יעבוד שם בלי פיצול מסיבי ל־CPU.

אותה משפחה

Carnice יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם גרסת IQ2_M תרוץ אצלי על כרטיס 16GB?

היא תיטען כי היא שוקלת 9.4GB, אבל תצטרכו לנהל את ה־KV cache בקפדנות. ברגע שתגדילו את חלון ההקשר מעבר לאלפי טוקנים בודדים, תחרגו ממגבלת הזיכרון.

למה מנוע ה־GGUF הישן שלי נכשל בטעינה?

המודל מומר בתצורת qwen35 שכוללת שכבות היברידיות מסוג SSM וקשב. גרסאות ישנות של ספריות הרצה לא תומכות בארכיטקטורה הזו וחובה לעדכן לגרסה חדשה של llama.cpp.

איך מריצים

ההרצה נעשית דרך llama.cpp, אבל חובה לבנות גרסה עדכנית כי הארכיטקטורה משלבת שכבות היברידיות מסוג SSM וקשב של Qwen3.5. יש כאן מנעד רחב של קבצים, החל מגרסת IQ2_M ששוקלת 9.4GB ומכוילת במיוחד לכרטיסי 16GB, ועד קובץ BF16 מלא של 51GB.

אם יש לכם כרטיס עם 16GB VRAM, גרסאות 2 ביט הן היחידות שמשאירות מקום מסוים לקונטקסט. לגרסת Q4_K_M ששוקלת 16GB כבר תצטרכו להוריד שכבות למעבד או להחזיק כרטיס של 24GB לפחות. אם המטרה היא קונטקסט מלא של עשרות אלפי טוקנים, עדיף לפנות לשרת ייעודי או ל־API, כי זיכרון ה־KV יחנוק את החומרה המקומית מהר מאוד.

ollama run hf.co/kai-os/Carnice-V2-27b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים פנימיים או חיצוניים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים וצירוף עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗