GPT
Q

Qwen2.5-7B-Instruct-1M-GGUF

קוד פתוח

lmstudio-communityapache-2.02025-01-25

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסת GGUF למודל של שבעה מיליארד פרמטרים שמסוגל לעבד חלון של עד מיליון תווכנים. מתאים למי שחייב להריץ עיבוד טקסטים ארוכים מקומית בלי לשלם לפי טוקן לענן.

  • 21.5 GBמשקל הקבצים
  • 15,312הורדות בחודש
  • 45לייקים

מה זה

מדובר במודל שנועד ליצירת טקסט ומבוסס על הארכיטקטורה של Qwen, כשהייחוד המרכזי שלו הוא היכולת לקבל קלט באורך של עד מיליון תווכנים. המטרה כאן היא לתת מענה למשימות של קריאת ספרים, תיעוד טכני מלא או קבצי קוד שלמים בבת אחת, בלי לאבד את היכולת לענות על שאלות קצרות ופשוטות כרגיל.

ההסבה לפורמט GGUF נעשתה על בסיס llama.cpp, מה שהופך אותו לנגיש ישירות בתוכנות מקומיות כמו LM Studio בלי צורך בהגדרות מסובכות של סביבת פייתון. המודל מתמקד בשפה האנגלית, וזה פתרון ממוקד למי שרוצה לדחוף כמויות ענק של מידע לתוך מודל קומפקטי יחסית של שבעה מיליארד פרמטרים על גבי המחשב האישי או השרת המקומי.

מתאים ל

  • ניתוח מסמכי ענק באנגלית

    עיבוד של מאמרים שלמים, תיעוד או ספרים עד רבע מיליון תווכנים ברמת דיוק טובה וללא תשלום חיצוני.

  • בדיקת קוד מקומית

    טעינת פרויקטים שלמים וחיפוש תלויות ישירות במחשב שלכם, בלי להוציא קוד קנייני החוצה.

  • עבודה מקומית ללא רשת

    סביבות פיתוח סגורות שדורשות עיבוד טקסטים ארוכים באנגלית על חומרה מקומית חזקה.

איפה זה נופל

למרות ההבטחה למיליון תווכנים, הכרטיס מציין בפירוש שיש ירידה ברמת הדיוק ברצפים שעוברים את 262,144 התווכנים, עד שייכנסו שיפורים נוספים. בנוסף, המודל מוגדר רשמית לאנגלית בלבד, כך שלא כדאי לבנות עליו לפענוח מסמכים בעברית או לניתוח שפה מקומית מורכבת.

שאלות
נפוצות

האם המודל באמת שומר על דיוק מלא עד מיליון תווכנים?

לא. הכרטיס מבהיר שמעבר ל־262,144 תווכנים יש ירידה באיכות ובדיוק של התוצאות, ולכן מומלץ להישאר מתחת לרף הזה למשימות קריטיות.

אפשר להשתמש בו לניתוח טקסטים בעברית?

המודל מוגדר רשמית לשפה האנגלית בלבד. הוא עשוי לפלוט מילים בעברית, אבל הוא לא אומן או נבדק על כך ולא הייתי סומך עליו לשימוש מקומי בשפה.

איך מריצים

הקבצים כולם שוקלים יחד 21.5 ג'יגה בייט ומחולקים לשישה חלקים, כך שתצטרכו להוריד אותם ולהשתמש בתוכנה שיודעת לטעון מודלים מפוצלים דרך llama.cpp. בשביל להחזיק את המודל בזיכרון, ועוד יותר מזה בשביל לנצל חלון הקשר ענקי, צריך כמות גדולה של זיכרון עבודה או זיכרון כרטיס מסך, הרבה מעבר לגודל הקובץ הבסיסי.

אם יש לכם מחשב ממוצע בלי כרטיס מסך חזק, החזקת הקשר של מאות אלפי תווכנים תחנוק את המערכת ותהיה איטית מאוד. במצב כזה, פנייה לשירות מנוהל בענן שגובה לפי שימוש תהיה זולה ופרקטית יותר מאשר שדרוג חומרה יקר.

ollama run hf.co/lmstudio-community/Qwen2.5-7B-Instruct-1M-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗