GPT
G

gemma-4-26B-A4B-it-Claude-Opus-Distill-GGUF

קוד פתוח

TeichAIapache-2.02026-04-04

  • gguf
  • text-generation-inference
  • llama.cpp
  • unsloth
  • gemma4

הכלאה בין בסיס פתוח לזיקוק שרשראות חשיבה מודרכות של קלוד אופוס. מיועד למי שמחפש היגיון חישובי צפוף בלי לשלם על קריאות רשת.

  • 168 GBמשקל הקבצים
  • 2,239הורדות בחודש
  • 43לייקים

מה זה

המודל לוקח את משקלי הבסיס של גוגל ומאמן אותם באמצעות Unsloth על מאגרי שיחות ברמת מאמץ חשיבה גבוהה, שנאספו מגרסאות שונות של קלוד אופוס וסונט. המטרה כאן היא לא עוד מודל שיחה כללי שמחזיר תשובה מהירה, אלא כזה שמפרק בעיות מורכבות לשלבים מובנים, מציג את תהליך המחשבה הפנימי שלו בתוך תגיות ייעודיות, ורק אז פולט פתרון סופי.

הבסיס כולל תמיכה מובנית בקלטי תמונה באמצעות תקציב טוקנים ויזואלי גמיש, לצד עיבוד מקטעי וידאו קצרים כפריימים עוקבים. השילוב הזה מכוון למשימות פיתוח תוכנה, הנדסת ארכיטקטורה וניתוח מחקרי, כשהזיקוק אמור לפצות על מגבלות הגודל ולייצר מבנה תשובות מסודר ומדויק יותר ממה שמקבלים לרוב בטווח המשקלים הזה.

מתאים ל

  • תכנון ארכיטקטורת תוכנה

    פירוק משימות קוד וארכיטקטורה מורכבות באמצעות שרשראות חשיבה מפורטות.

  • ניתוח מסמכים ומחקר

    שילוב תמונות ברזולוציה גמישה לצורך פענוח מסמכים והסקת מסקנות מדעיות.

  • מעקב והסבר תהליכים

    צפייה בבלוק החשיבה הפנימי כדי לוודא את נכונות ההיגיון לפני קבלת ההחלטה.

איפה זה נופל

היוצרים עצמם מודיעים בעמוד המודל שכבר קיימת גרסה שנייה ומשופרת, וממליצים לעבור אליה ישירות. בגרסה הנוכחית התגלו בעיות בתבנית השיחה ובמבנה התשובות, לצד נתיבי חשיבה פחות יציבים שתוקנו רק בגרסה הבאה. בנוסף, המודל הזה לא תומך בקלט אודיו, בניגוד לגרסאות אחרות באותה משפחה, ואורך קטעי הווידאו מוגבל לשישים שניות לכל היותר בקצב של פריים לשנייה. בשיחות מרובות שלבים חובה לנקות את בלוק המחשבה מההיסטוריה לפני הפנייה הבאה, אחרת הפלט מתחיל להשתבש.

אותה משפחה

gemma-4-26B-A4B-it-Claude-Opus יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את הקבצים האלה עכשיו?

עדיף שלא. המפתחים עצמם מציינים במפורש שיצאה גרסה שתיים עם תיקוני באגים בתבנית השיחה ושיפור מהותי ביכולות ההיגיון, וממליצים להשתמש בה.

איך שולטים במצב החשיבה של המודל?

מוסיפים את התגית הייעודית בתחילת הנחיית המערכת כדי לקבל את תהליך החשיבה המלא. אם מורידים אותה, המודל עדיין ייצר את התגיות אך ישאיר אותן ריקות.

האם אפשר להזין למודל הקלטות קול?

לא. התמיכה באודיו קיימת רק בדגמים הקטנים יותר בסדרה, והדגם הנוכחי מקבל טקסט, תמונות וסרטונים עד שישים שניות בלבד.

איך מריצים

הקבצים בפורמט GGUF תופסים סך של 168 גיגה בייט ומחולקים לשלושה עשר קבצים, מה שמתאים לטעינה ישירה דרך llama.cpp או ספריות דומות. בשביל להריץ גרסה כזו באופן מקומי צריך חומרה ייעודית עם כמות זיכרון משמעותית, לרוב כמה כרטיסי מסך חזקים או שרת עם זיכרון מאוחד גדול, אחרת הביצועים ייחתכו משמעותית ברגע שהמודל יזלוג לזיכרון המערכת הרגיל.

אם אתם צריכים רק מענה מהיר לבקשות נקודתיות ולא מחזיקים שרת פעיל, פנייה ישירה לשרותי ענן חיצוניים תהיה זולה ופשוטה בהרבה מתחזוקת תשתית מקומית כזו. בהרצה עצמית חובה להגדיר את הפרמטרים המומלצים: טמפרטורה של 1.0, top p של 0.95 ו־top k של 64, לצד הפעלת תגית החשיבה בתחילת פקודת המערכת.

ollama run hf.co/TeichAI/gemma-4-26B-A4B-it-Claude-Opus-Distill-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המערכת בתוך מוצרים פנימיים או חיצוניים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית, בלי דרישה לחשוף את השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗