GPT
Q

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-i1-GGUF

קוד פתוח

mradermacherapache-2.02026-03-06

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3.5

גרסת קוונטיזציה של מודל 27B שעבר זיקוק להסקה לוגית. הוא מיועד למי שרוצה יכולות חשיבה מתקדמות של קלוד בחבילה מקומית שמתאימה לחומרה ביתית או שרת בודד.

  • 273 GBמשקל הקבצים
  • 313,099הורדות בחודש
  • 122לייקים

מה זה

מדובר בהמרה של המודל Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled לפורמט GGUF תוך שימוש במטריצת חשיבות imatrix. הרעיון כאן הוא לקחת בסיס של 27 מיליארד פרמטרים, להזריק לתוכו דפוסי פתרון בעיות ונימוק שמחקים את קלוד אופוס, ולכווץ אותו כך שיוכל לרוץ במהירות סבירה.

המאגר מציע מגוון רחב של שקילות, החל מגרסאות זעירות של 6.3 גיגה בייט ועד לקבצים של 22.2 גיגה בייט. בניגוד לקוונטיזציה רגילה, שיטת ה־imatrix משמרת משקלים קריטיים על בסיס נתוני כיול, מה שמצמצם את הפגיעה באיכות התוצאה במיוחד בגרסאות ה־IQ הבינוניות והנמוכות.

מתאים ל

  • הסקה לוגית מקומית

    מתאים לפתרון בעיות מורכבות וניתוח נתונים בסביבה סגורה ללא הוצאת מידע לרשת.

  • בדיקות חומרה מוגבלת

    מגוון הגרסאות מאפשר להריץ מודל 27B על כרטיס מסך בודד של 16 או 24 גיגה.

  • פיתוח באנגלית וסינית

    נותן מענה יעיל לאפליקציות שמתמקדות בשפות הנתמכות רשמית במודל המקור.

איפה זה נופל

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד, כך שלא הייתי בונה עליו לעיבוד שפה טבעית בעברית בלי לבדוק אותו ביסודיות תחילה. בנוסף, מודל המקור מוגדר כמודל ראייה, אך קובצי ה־mmproj הנחוצים לעיבוד תמונה לא נמצאים במאגר הזה אלא דורשים הורדה נפרדת. גרסאות ה־IQ הנמוכות מאוד מתחת ל־8 גיגה בייט סובלות מירידה תלולה באיכות הפלט, והמפתח עצמו מגדיר אותן כפתרון למי שנואש בלבד.

שאלות
נפוצות

איזו גרסה מהרשימה כדאי להוריד לשימוש יומיומי?

הגרסה המומלצת ביותר היא i1-Q4_K_M בנפח 16.6 גיגה בייט, שמספקת את האיזון הטוב ביותר בין מהירות, גודל ודיוק. אם יש לכם מגבלת זיכרון מחמירה יותר, לכו על i1-IQ3_M ששוקלת 12.7 גיגה בייט ועדיפה על פני גרסאות ה־Q3 הרגילות.

האם המודל תומך בעיבוד תמונות ישירות מהקבצים האלה?

לא באופן ישיר. המודל אמנם מוגדר כמודל ראייה, אבל קובצי ה־mmproj הנדרשים לעיבוד תמונה שמורים במאגר נפרד לקוונטיזציות סטטיות, כך שתצטרכו להביא אותם משם כדי להפעיל יכולות מולטימודליות.

איך מריצים

כדי להריץ את הגרסה המומלצת, i1-Q4_K_M ששוקלת 16.6 גיגה בייט, אתם צריכים כרטיס מסך עם 24 גיגה זיכרון כדי להכניס את כל המשקלים יחד עם הקשר עבודה בסיסי. אם אתם מוכנים להסתפק ב־i1-IQ3_M ששוקל 12.7 גיגה בייט, תוכלו להריץ אותו אפילו על כרטיס עם 16 גיגה זיכרון תוך שמירה על ביצועים שפויים.

מי שמחזיק מעבד בלבד יחווה קצב איטי של טוקנים לשנייה, במיוחד במודל עם שרשראות הסקה ארוכות שמייצרות המון פלט. במצב כזה, אם אתם לא מחויבים לפרטיות מוחלטת של המידע, עדיף פשוט לצרוך מודל גדול יותר דרך API חיצוני.

ollama run hf.co/mradermacher/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-i1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

26 קבצים במאגר, 273 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך מוצר, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗