GPT
Q

Qwen3-4B-toolcalling-gguf-codex

קוד פתוח

Manojbmit2025-09-21

  • safetensors
  • gguf
  • qwen3
  • function-calling
  • tool-calling

גרסת GGUF קומפקטית שמיועדת להפעלת פונקציות וכלים מקומית. היא מתאימה למי שרוצה סוכן חכם על כרטיס מסך פשוט, בלי תלות ברשת ובלי לשלם לפי קריאה.

  • 262,144טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 3,026הורדות בחודש
  • 55לייקים

מה זה

מדובר בהתאמה של Qwen3-4B-Instruct שעברה אימון ממוקד על שישים אלף דוגמאות של הפעלת פונקציות. המטרה כאן היא לקחת הוראה בשפה טבעית, לפרק אותה לשלבים ולהחזיר את שמות הכלים והארגומנטים הנכונים, למשל ניתוח קובץ והצגת גרף או שליפת נתוני מזג אוויר. הפורמט מגיע מוכן לעבודה מקומית ומחולק לחמישה עשר קבצים בנפח כולל של ארבעה גיגה בייט.

בגודל הזה של ארבעה מיליארד פרמטרים, רוב המודלים מתקשים לחלץ מבני נתונים בלי להמציא שדות או להתבלבל בתחביר. כאן היוצר מדווח על דיוק של מעל תשעים וארבעה אחוזים בקריאות עצמן, לצד הפסד אימון של אפס נקודה חמש מאות שמונה עשרה. זה אומר שבמקום לקבל מודל שיחה כללי, מקבלים רכיב שמכוון ישירות לשילוב בקוד ובצינורות עיבוד אוטומטיים.

היתרון המרכזי מול מה שרץ כיום על מחשבים אישיים הוא היכולת לנהל שרשרת קריאות בלי להתפזר. התוצאות מראות דיוק גבוה גם בזיהוי הכלי המתאים וגם בשליפת הפרמטרים, תכונות שלרוב שמורות למודלי ענן כבדים ויקרים בהרבה.

מתאים ל

  • סוכן מקומי להרצת פקודות

    מפעיל סקריפטים ומנתח קבצים ישירות על המחשב, בלי לשלוח נתונים החוצה ובלי לחכות לשרת.

  • חילוץ פרמטרים לקריאות API

    הופך טקסט חופשי למבנה נתונים מסודר עם דיוק מוכח של מעל תשעים אחוזים בשליפת ארגומנטים.

  • עוזר קידוד פרטי

    מתחבר לכלים מקומיים כמו פנדס או גיטהאב בלי עלויות לפי טוקן ובלי לחשוף סודות מסחריים.

איפה זה נופל

למרות ההבטחות על חלון הקשר ענק של מאתיים שישים ושניים אלף טוקנים, בפועל זיכרון גרפי של שישה גיגה יקרוס הרבה לפני שתתקרבו לקצה שלו. מעבר לזה, המודל אומן ותועד באנגלית בלבד. אם תנסו להעביר לו שמות משתנים או הוראות מורכבות בעברית, סביר להניח שהחילוץ ישתבש והתחביר יתפרק. קחו בחשבון גם שהמדדים בכרטיס נבדקו על סט המבחן של היוצר בלבד, כך שבקוד אמיתי עם סכמות מורכבות צריך לבדוק אותו בזהירות לפני שמסתמכים עליו.

שאלות
נפוצות

האם המודל תומך בעבודה מלאה בעברית?

החומר הרשמי מגדיר את המודל לשפה האנגלית בלבד. אפשר לנסות להזין לו קלט בעברית, אבל בהפעלת פונקציות ובחילוץ פרמטרים הוא צפוי להיכשל או להחזיר שגיאות מבניות.

איזה כרטיס מסך מינימלי צריך בשביל לעבוד איתו?

המפרט דורש לפחות שישה גיגה בייט של זיכרון גרפי, כמו בכרטיסי RTX 3060 או RTX 4060, יחד עם שמונה גיגה זיכרון עבודה במחשב עצמו.

יש סתירה בין הרישיונות בעמוד, מה מותר לעשות איתו בפועל?

במערכת רשום רישיון MIT ובטקסט צוין Apache 2.0. שניהם רישיונות חופשיים שמאפשרים שילוב במוצרים מסחריים בלי עלות, כך שמבחינה מעשית מותר להשתמש בו בחופשיות.

איך מריצים

ההרצה פשוטה מאוד ועובדת ישירות מול Ollama בפקודה אחת עם קובץ מודל ייעודי. מבחינת חומרה תצטרכו כרטיס מסך עם שמונה גיגה זיכרון מערכת ושישה גיגה זיכרון גרפי לפחות, מה שאומר שכרטיסים בסיסיים כמו RTX 3060 או מקביל יעשו את העבודה בלי לחנוק את המחשב. צריך גם כחמישה גיגה פנויים בדיסק לאחסון הקבצים.

אם יש לכם שרת מקומי או מחשב פיתוח מתאים, ההרצה המקומית חוסכת את העלויות המצטברות של ענן. מצד שני, אם אתם מריצים מערכת שדורשת זמינות גבוהה בלי להחזיק כרטיס ייעודי דולק, שימוש בשרות ענן קיים יחסוך את כאב הראש של תחזוקת הברזלים.

ollama run hf.co/Manojb/Qwen3-4B-toolcalling-gguf-codex:Qwen3-4B-Function-Calling-Pro

הרישיון

הרישיון המדווח במטא דאטה הוא MIT, למרות שבגוף הטקסט נכתב Apache 2.0. בשני המקרים מדובר ברישיונות קוד פתוח מתירניים במיוחד שמאפשרים שימוש מסחרי מלא, שינוי והפצה, בלי דרישה לחלוק קוד קנייני.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗