GPT
G

gemma-4-12B-it-Claude-4.6-4.8-Opus-GGUF

קוד פתוח

yuxinlu1apache-2.02026-06-04

  • gguf
  • safetensors
  • gemma4
  • reasoning
  • thinking

זיקוק של יכולות חשיבה ממודלי אופוס לתוך מודל מקומי קומפקטי. הוא נותן מענה למי שרוצה חשיבה מובנית וכתיבת קוד במחשב האישי בלי תלות ברשת.

  • 56.6 GBמשקל הקבצים
  • 4,333הורדות בחודש
  • 124לייקים

מה זה

מדובר בהתאמה אישית של מודל הבסיס של גוגל, שעבר אימון נוסף על גבי דאטה סינתטי של הסקת מסקנות שמקורו במודלי אופוס השונים. המטרה כאן ברורה, להביא יכולות פתרון בעיות וניתוח של מודלי ענק אל תוך משקל קל שרץ על חומרה ביתית סבירה. המודל מייצר שרשרת חשיבה בערוץ ייעודי ומגיב באופן ישיר לשאלות מורכבות, ניתוח לוגי וכתיבת סקריפטים.

החידוש העיקרי בחבילה הזו הוא שילוב מודל טיוטה קטן לחיזוי מרובה של טוקנים. בבדיקה שנעשתה על כרטיס יחיד מסוג אר טי אקס 5090 עם גרסת המשקל הבינונית, השימוש במנגנון הזה הניב האצה של פי 1.2 עד פי 1.3 בקצב הפליטה בלי לאבד שום דיוק בתוצאה הסופית. מודל הטיוטה מבוסס על מודל המקור ולא אומן מחדש על נתוני הזיקוק, כך שהאצת הביצועים נמוכה במעט מזו של מודל הבסיס, אך עדיין מדובר בתוספת מהירות שמגיעה ללא עלות חישובית כבדה.

מתאים ל

  • פיתוח קוד מקומי ואופליין

    מאפשר לייצר סקריפטים ולנתח תקלות ישירות מהמחשב האישי בלי לחשוף קוד פנימי לרשת.

  • פירוק בעיות לוגיות

    מייצר שלבי ניתוח מסודרים בזכות אימון ייעודי על דאטה של הסקת מסקנות ממודלי אופוס.

  • עיבוד טקסטים ארוכים באנגלית

    תומך בחלון הקשר של עד 131 אלף טוקנים על גבי חומרה עם מספיק זיכרון תואם.

איפה זה נופל

האימון הסיר כמעט לחלוטין את מנגנוני הסירוב וההסתייגות, כך שהמודל נעדר מנגנוני בטיחות מובנים ויענה על בקשות מסוכנות אם לא תציבו לו חסימות חיצוניות. בנוסף, החומר מדגיש שהמודל ממוקד באנגלית, ולכן ביצועיו בעברית לא נבדקו וצפויים להיות מוגבלים. שרשרת החשיבה שלו היא חיקוי סגנוני של דאטה סינתטי, מה שאומר שהוא נשמע מאוד משכנע ומובנה, אבל הוא נוטה לטעויות בעובדות ובחישובים מספריים שחובה לאמת באופן עצמאי.

שאלות
נפוצות

איזה קובץ בדיוק כדאי להוריד כדי להתחיל?

האפשרות המומלצת לרוב השימושים היא גרסת Q4_K_M ששוקלת 6.87 גיגה. אם החומרה שלכם מאפשרת זאת ותרצו מהירות גבוהה יותר, הורידו לצדה גם את קובץ הטיוטה הקטן בתיקיית האצה.

האם המודל יסרב לבצע משימות מסוימות?

האימון נעשה ללא מנגנוני הבטיחות הרגילים, כך ששיעור הסירובים נמוך מאוד ביחס למודל המקורי. אם אתם מתכננים להנגיש אותו למשתמשי קצה במוצר, תצטרכו להגדיר סינון תכנים משלכם.

האם אפשר להשתמש בו ישירות מול משתמשים דוברי עברית?

המודל מוגדר במפורש כממוקד באנגלית. הוא אומן על נתונים באנגלית בלבד, ולכן לא מומלץ להסתמך עליו לפניות או משימות שדורשות הבנה והפקה של עברית מדויקת.

איך מריצים

כדי להריץ אותו צריך גרסה מעודכנת של לאמה סי פי פי שתומכת בארכיטקטורה של ג'מה 4, או תוכנות כמו אל אם סטודיו ואולאמה. ברמת החומרה, המשקל הנמוך ביותר דורש סביב 4.5 גיגה זיכרון וידאו, אבל גרסת הביניים המומלצת תופסת כמעט שבעה גיגה. אם יש לכם כרטיס של 8 גיגה, תוכלו להריץ אותה בהקשר קצר של אלפיים עד ארבעת אלפים טוקנים. עם 16 גיגה ומעלה כבר אפשר לפתוח הקשר רחב של עשרות אלפי טוקנים.

ההבדל בין הגרסאות מסתכם באיכות מול זיכרון, כשגרסת 4 ביט היא נקודת האיזון, וגרסת 8 ביט שוקלת קרוב לשנים עשר גיגה ומיועדת למי שלא מוכן להתפשר על דיוק. אם אתם זקוקים לכל 131 אלף הטוקנים באופן קבוע תחת עומס ואין לכם כרטיס של 24 גיגה, עדיף לפנות למודל מרוחק דרך שירות ענן.

ollama run hf.co/yuxinlu1/gemma-4-12B-it-Claude-4.6-4.8-Opus-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0 המאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או חיצונית בתוך מוצרים. אין כאן הגבלות שימוש ייחודיות מעבר לדרישה לשמור על הודעת הרישיון והקרדיט המקורי, והוא מגיע ללא כל אחריות מצד היוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗