GPT
J

Jan-nano

קוד פתוח

Menloapache-2.02025-06-10

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

מודל קומפקטי שנבנה במיוחד לפעול כסוכן מחקר עצמאי דרך פרוטוקול MCP. הוא מוציא קריאות לכלים בלי שרשראות חשיבה ארוכות ובלי לבזבז משאבי חומרה כבדים.

  • 4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 7.6 GBמשקל הקבצים
  • 699הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Qwen3 בגודל של 4 מיליארד פרמטרים, אשר עבר אופטימיזציה ישירה לעבודה מול שרתי Model Context Protocol. בניגוד לרוב המודלים בגודל הזה שמנסים לענות על הכל מהזיכרון הפנימי שלהם, הוא תוכנן מראש להסתמך על מקורות מידע וכלים חיצוניים כדי לבצע משימות מחקר מעמיקות. היוצרים מציינים במפורש שהוא מוגדר כמודל ללא חשיבה, כלומר הוא לא מייצר בלוקים פנימיים של reasoning אלא ניגש ישר לקרוא לכלים ולספק תשובות.

בבדיקות מול SimpleQA החוקרים בדקו אותו במתודולוגיה שמשלבת שרתי MCP במקום מבחן ידע סגור ורגיל. הרעיון כאן פשוט, בודקים איך מודל קטן מתמודד עם דיוק עובדתי כשיש לו גישה לכלים חיצוניים בזמן אמת, והתוצאות נועדו לשקף את היכולת שלו להביא נתונים אמיתיים בלי להמציא תשובות מהראש.

מתאים ל

  • סוכן מחקר מקומי

    חיבור ישיר לשרתי MCP כדי לשלוף מידע ממקורות חיצוניים ולסכם אותו בלי צורך בשרתים כבדים.

  • הפעלת כלים באוטומציה

    הרצה מקומית וזולה שמזהה מתי לקרוא ל־API ולכלי מערכת חיצוניים בעזרת פרסר hermes.

  • עבודה פרטית על המחשב

    הרצה מהירה בתוך אפליקציית Jan הביתית לשמירה על פרטיות המידע המעובד במחקר.

איפה זה נופל

הכרטיס מדגיש במפורש שמדובר במודל non-thinking. הוא לא עוצר לנתח בעיות מורכבות שלב אחרי שלב בעצמו, ולכן אם תתנו לו בעיית היגיון או תכנות בלי לתת לו כלים מתאימים ב־MCP, הוא יתקשה מאוד.

הבדיקה שלו ב־SimpleQA נשענת על סביבה שבה שרתי הכלים פעילים ומחזירים תשובות. אם סביבת ה־MCP שלכם לא יציבה או שהכלים מחזירים פלט מלוכלך, איכות התוצאות תרד מיד כי המודל עצמו קטן מכדי לפצות על מידע שגוי.

אותה משפחה

Jan-nano יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה הכוונה בהערה שהמודל הוא non-thinking?

המודל אומן לא לפלוט טקסט של חשיבה עצמית לפני שהוא עונה. הוא לא מנתח שלבים בטקסט ארוך אלא מפעיל כלים ומשתמש במידע שהם מחזירים כדי להגיע לתוצאה.

איך צריך להגדיר את vLLM כדי שהקריאות לכלים יעבדו?

צריך להפעיל את הדגל enable-auto-tool-choice ולהגדיר את tool-call-parser כ־hermes. מומלץ להשתמש בטמפרטורה 0.7 ו־Top-p של 0.8 לפי המלצות המפתחים.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.6 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 12 או 16 גיגה זיכרון יספיק לגמרי להרצה מקומית מלאה. אפשר להריץ אותו מקומית בקלות דרך האפליקציה של Jan, או להעלות שרת עצמאי עם vLLM באמצעות שימוש בפרסר הכלים hermes והפעלת בחירת כלים אוטומטית.

אם אתם לא מחברים אותו לשרתי כלים דרך MCP, אין שום סיבה להריץ אותו בעצמכם. במצב כזה מודלים כלליים גדולים יותר הזמינים ב־API מסחרי רגיל יעשו עבודה טובה בהרבה בניסוח ובידע כללי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Menlo/Jan-nano")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים והפצה של המערכת בתוך מוצר פרטי, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗