GPT
J

Jan-v1-4B-GGUF

קוד פתוח

janhqapache-2.02025-08-11

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • conversational

גרסת GGUF של מודל 4B המכוון לסוכנים אוטונומיים והפעלת כלים. הוא בנוי לחשיבה מעמיקה ומיועד למי שרוצה להריץ לוקאלית מודל קומפקטי שמסוגל לענות על שאלות בדיוק גבוה.

  • 12.2 GBמשקל הקבצים
  • 3,482הורדות בחודש
  • 140לייקים

מה זה

מדובר במודל הראשון בסדרת Jan, שמבוסס על Lucy ועל Qwen3-4B-thinking. המטרה כאן היא לתת מענה למשימות של סוכנים, כלומר הבנת פקודות מורכבות, חשיבה שלב אחר שלב והפעלת כלים חיצוניים דרך ממשק ייעודי. סך כל הקבצים במאגר שוקל 12.2 גיגה בייט ומחולק לשבעה קבצים בפורמט שמתאים לריצה מקומית.

במבחן SimpleQA המפתחים מדווחים על דיוק של 91.1 אחוזים במענה על שאלות עובדתיות. בפועל זה אומר שביחס לגודל של ארבעה מיליארד פרמטרים, הוא מצליח לשלוף מידע בצורה יציבה יחסית ולא להמציא תשובות באותה תדירות שרואים במודלים קטנים אחרים. המאגר מכיל גם תמיכה ישירה בפרסר של הרמס לקריאות כלים.

מתאים ל

  • סוכנים מבוססי כלים מקומיים

    המודל כולל ארכיטקטורה המותאמת לשימוש בכלים ובפרסר hermes, מה שמתאים לאוטומציות לוקאליות.

  • שליפת עובדות במערכות סגורות

    תוצאת 91.1 אחוז ב־SimpleQA מאפשרת להסתמך עליו למענה עובדתי מהיר באנגלית בלי ענן.

  • עבודה בתוך אפליקציית Jan

    המודל מותאם ישירות לאפליקציה ונטען בה ישירות ללא צורך בהגדרות שרת מורכבות.

איפה זה נופל

המודל מוגדר רשמית רק עבור השפה האנגלית, כך שאין שום הבטחה או בדיקה לגבי תפקוד בעברית. בנוסף, המפתחים מדגישים שהביצועים מהמבחנים תלויים בפרומפט מערכת מובנה שנמצא בתבנית השיחה. אם תשתמשו בתבנית הגולמית בלי הפרומפט הזה, יכולת ההסקה והדיוק של המודל עלולות לרדת משמעותית.

אותה משפחה

Jan יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יפעל בצורה טובה בעברית?

הנתונים הרשמיים מגדירים את שפת המודל כאנגלית בלבד. הוא לא אומן או נבדק לעברית, ולכן עדיף להניח שהוא לא יתאים למשימות כאלה ללא בדיקה קונקרטית מצידכם.

למה יש חשיבות לתבנית השיחה המסוימת שמגיעה איתו?

המפתחים ציינו שתבנית השיחה כוללת פרומפט מערכת שמביא אותו לביצועים שנמדדו במבחנים. שימוש בקובץ התבנית ללא הפרומפט עלול לפגוע באיכות התשובות וביכולת השימוש בכלים.

איך מריצים

בשביל להריץ אותו דרך llama.cpp צריך פשוט להוריד את קובץ ה־GGUF ולהרים שרת מקומי עם הדגל jinja וביטול context shift. אפשר להריץ אותו גם באפליקציית Jan עצמה או דרך vLLM עם פרסר כלים hermes. בגלל שמדובר במודל קטן יחסית, כרטיס מסך ממוצע או אפילו מעבד מודרני עם זיכרון סביר יספיקו כדי לקבל קצב יצירה טוב.

המפתחים ממליצים על טמפרטורה של 0.6, ערך top p של 0.95, ומגבלת יצירה של 2048 טוקנים. אם אתם צריכים רק שאילתות טקסט פשוטות בלי שימוש בכלים או שאין לכם חומרה פנויה, אין טעם להסתבך עם התקנה מקומית ועדיף לקרוא למודל מרוחק דרך API.

ollama run hf.co/janhq/Jan-v1-4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

7 קבצים במאגר, 12.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים פנימיים או חיצוניים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗