GPT
L

Lucy-128k

קוד פתוח

Menloapache-2.02025-07-18

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

שילוב נדיר של מודל זעיר עם חלון הקשר עצום, שמכוון ישירות למשימות חיפוש רשת וגלישה עצמאית. הוא מיועד למי שרוצה סוכן חכם שרץ מקומית אפילו על מעבד של מכשיר נייד.

  • 1.7Bפרמטרים
  • 131,072טוקנים בהקשר
  • 3.5 GBמשקל הקבצים
  • 129הורדות בחודש

מה זה

מדובר במודל שמבוסס על Qwen3-1.7B ועבר אימון בלמידת חיזוק טהורה, בלי כוונון מונחה בכלל, לצד וקטורי משימה שנוצרו במכונה כדי לחדד תהליכי חשיבה. המטרה העיקרית שלו היא לשמש סוכן שמפעיל כלי חיפוש ברשת וגלישה בסיסית דרך פרוטוקול MCP, עם כלים כמו Serper ו־Crawl4AI.

הייחוד כאן הוא הביצועים ביחס לגודל. במבחן SimpleQA תחת מתודולוגיית MCP, המפתחים מציגים דיוק שעוקף מודל ענק כמו DeepSeek-v3. זה אומר שכאשר נותנים לו גישה לכלי חיפוש מתאימים, הוא יודע לשלוף עובדות ולסנן מידע טוב יותר ממודלים כבדים בהרבה שנשענים רק על הזיכרון הפנימי שלהם.

מתאים ל

  • סוכן מחקר במכשיר נייד

    הוא קל מספיק לרוץ על מעבד טלפון ומכוון לביצוע שאילתות וסיכום תוצאות רשת.

  • אוטומציית חיפוש ב־MCP

    עבר אופטימיזציה ישירה לפרוטוקול כלי החיפוש עם תמיכה ב־Serper.

  • קריאת מסמכים ארוכים מקומית

    חלון של 128k טוקנים מאפשר להזין דפי אינטרנט שלמים בלי לחתוך מידע.

איפה זה נופל

המודל אומן ומוגדר רשמית רק עבור השפה האנגלית, כך שאין מה לבנות עליו לפעולות מורכבות בעברית. בנוסף, כל החוזק שלו נשען על חיבור לכלים חיצוניים. אם תנתקו אותו משרתי ה־MCP והחיפוש, מודל של 1.7 מיליארד פרמטרים עדיין מוגבל מאוד בידע העולם הפנימי שלו ויסבול מטעויות מהר מאוד.

אותה משפחה

Lucy יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לעבוד כמו שצריך בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. סביר להניח שהוא יזהה עברית ברמה בסיסית בגלל בסיס ה־Qwen, אבל הוא לא אומן לחקור או לחפש בעברית ולא כדאי להסתמך עליו למשימות כאלה.

איך מריצים חלון של 128k על מודל כזה קטן בלי לפוצץ את הזיכרון?

צריך להגדיר הרחבת RoPE מסוג YaRN עם מקדם של 3.2 לפי הפקודות שהמפתחים פרסמו. זה מאפשר למתוח את ההקשר מעבר ל־40,960 הטוקנים המקוריים בלי לדרוש אימון מחדש של הארכיטקטורה.

איך מריצים

המשקל הכולל עומד על 3.5 גיגהבייט בדיוק bfloat16, מה שאומר שכרטיס מסך בסיסי עם 6 עד 8 גיגהבייט זיכרון יריץ אותו בקלות. אם מכווצים אותו עוד קצת בפורמט של llama.cpp, אפשר להריץ אותו ישירות על מעבד של מחשב נייד או טלפון בלי להרגיש חנק בביצועים.

אפשר להרים אותו דרך vLLM או llama-server, אבל צריך לשים לב להגדרות ה־RoPE הייעודיות עם פקטור 3.2 כדי לנצל את כל ההקשר. אם אתם לא צריכים ריצה מקומית על הקצה לצורכי פרטיות או אופליין, קריאה ל־API של מודל ענן פשוט תחסוך לכם את תחזוקת שרתי ה־MCP והחיבור לרשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Menlo/Lucy-128k")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו במוצרים מסחריים, לשנות את הקוד והמשקולות, ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗