GPT
J

Jan-nano-128k-gguf

קוד פתוח

Menloapache-2.02025-06-24

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • imatrix

גרסת GGUF למודל מחקר קומפקטי שמביא חלון הקשר של 128k טוקנים. הוא מיועד למי שרוצה להריץ מודל מקומי לקריאת מסמכים ארוכים בלי שרשרת חשיבה.

  • 34.9 GBמשקל הקבצים
  • 2,578הורדות בחודש
  • 75לייקים

מה זה

מדובר במודל שמכוון ישירות לעבודה עם טקסטים ארוכים, קריאת מאמרים מדעיים ושיחות מרובות שלבים. הוא מגיע עם תמיכה מלאה בפרוטוקול MCP לחיבור לכלים חיצוניים, והיוצרים שלו בחנו אותו מול מבחן SimpleQA כדי להראות שיפור בדיוק מול הגרסה הקודמת.

בניגוד לפתרונות רבים שמנסים לחשוב צעד אחר צעד, מוגדר כאן במפורש שמדובר במודל שאינו מודל חשיבה, כלומר הוא עונה ישירות בלי שלבי ביניים. הדגש העיקרי שלו הוא שמירה על ביצועים יציבים לאורך כל 128 אלף הטוקנים, במיוחד בעיבוד מידע ממספר מקורות במקביל.

מתאים ל

  • ניתוח מאמרים באנגלית

    קריאה וסיכום של מסמכי מחקר ארוכים בזכות חלון של 128k טוקנים ללא פיצול הקובץ.

  • חיבור שרתי MCP

    הפעלת קריאות לכלים חיצוניים במסגרת תהליכי עבודה אוטומטיים במחקר.

  • שיחות מרובות שלבים

    מעקב אחרי היסטוריית שיחה ארוכה ומורכבת בלי לאבד את ההקשר ההתחלתי.

איפה זה נופל

המודל מוגדר רשמית כמודל באנגלית בלבד, כך שלא כדאי לבנות עליו לפענוח מסמכים בעברית או משימות מקומיות. נקודה קריטית נוספת היא שאין כאן שרשרת חשיבה פנימית, מה שאומר שבמשימות היגיון מורכבות במיוחד שדורשות תכנון מקדים הוא עלול לפספס. בנוסף, ההרצה דורשת הגדרות RoPE מדויקות ותבנית צ'אט ספציפית, ואם תטעו בהן תקבלו פלט משובש.

אותה משפחה

Jan-nano יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד בעברית?

המודל הוכרז ומתועד עבור השפה האנגלית בלבד. לא מומלץ להסתמך עליו לעיבוד טקסטים בעברית.

למה התשובות יוצאות שבורות בתוכנות צ'אט מקומיות?

הוא דורש תבנית ג'ינג'ה מיוחדת ללא חשיבה וקינפוג מדויק של YaRN. אם הממשק שלכם לא מגדיר אותם אוטומטית, צריך לייבא את התבנית המתאימה ולהזין את מקדם ההרחבה ידנית.

איך מריצים

כדי להריץ אותו מקומית דרך llama.cpp או vllm, אתם חייבים להגדיר ידנית פרמטרים של RoPE מסוג YaRN עם פקטור 3.2 וגודל מקורי של 40,960, אחרת ההקשר הארוך ישבר. סך הקבצים שוקל כמעט 35 גיגה בייט בגרסאות השונות שלו, כך שתצטרכו כרטיס מסך חזק עם זיכרון וידאו נדיב אם תרצו לנצל את מלוא ההקשר בלי לזחול לזיכרון המערכת.

היוצרים מציינים שהתמיכה בתוכנת Jan desktop עצמה עדיין בעבודה, כך שנכון לעכשיו מריצים אותו ישירות דרך שרת ייעודי או סביבות כמו LMStudio, שם ייתכן שתצטרכו להחליף את תבנית הצ'אט ידנית לתבנית ללא חשיבה.

ollama run hf.co/Menlo/Jan-nano-128k-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה בתוך מוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗