GPT
M

marqo-ecommerce-embeddings-L

קוד פתוח

Marqoapache-2.02024-09-26

  • open_clip
  • safetensors
  • siglip
  • clip
  • ecommerce

מודל שיודע לחבר בין טקסט לתמונות של מוצרים בחנויות מקוונות. הוא עוקף מודלים כלליים כי הוא אומן ישירות על קטלוגים מסחריים ולא על תמונות כלליות מהרשת.

  • 652Mפרמטרים
  • 7.3 GBמשקל הקבצים
  • 44,258הורדות בחודש
  • 57לייקים

מה זה

מדובר במודל מולטימודלי ממשפחת CLIP שמייצר וקטורים בגודל 1024 ממדים עבור מוצרים, תמונות ושאילתות חיפוש. במקום לאמן על מאגרים מעורבבים של ויקיפדיה או רשתות חברתיות, הצוות של Marqo כיוון אותו לדאטה מסחרי נקי של מוצרים, כותרות וקטגוריות.

בבדיקות מול ארבעה מיליון פריטים הוא משאיר אבק למודלים כלליים. במשימת התאמת טקסט לתמונה במאגר קשה של אמזון הוא הגיע לציון 0.658 ב־mAP ו־0.854 ב־Recall@10, לעומת מודלים מובילים כמו SigLIP או Amazon Titan שנשארים הרחק מאחור. המשמעות בפועל פשוטה: חיפוש טקסטואלי של לקוח מוצא את המוצר הנכון בתמונות הרבה יותר פעמים ובמיקומים ראשונים יותר.

מתאים ל

  • חיפוש טקסט לתמונה בקטלוג

    מאפשר ללקוח לחפש תיאור קצר ולקבל תמונות מדויקות של מוצרים רלוונטיים.

  • סיווג מוצרים לפי תמונה

    משייך מוצר חדש לקטגוריה הנכונה על בסיס התמונה בלבד ובדיקת דמיון וקטורי.

  • החלפת מודלי ראייה כלליים

    משפר דיוק באתרי מסחר שמשתמשים כיום ב־CLIP רגיל ולא ממוקד.

איפה זה נופל

חלון ההקשר הטקסטואלי בסקריפטים מוגדר ל־64 טוקנים בלבד. אם יש לכם תיאורי מוצר ארוכים, ביקורות של משתמשים או מפרטים טכניים מפורטים, המודל הזה יחתוך אותם ולא ילמד מהם. הוא נבנה עבור כותרות קצרות ושאילתות חיפוש.

בנוסף, כל המבחנים והאימונים נשענים על אנגלית מפלטפורמות כמו אמזון וגוגל שופינג. לא דווח שום מידע על תמיכה בעברית, ולכן בקטלוגים מקומיים או בשאילתות בעברית הוא כנראה ייכשל לחלוטין בלי אימון מקדים או תרגום שקט ברקע.

שאלות
נפוצות

איך המודל הזה מתמודד עם חיפוש בעברית?

הכרטיס מציג בדיקות על גוגל שופינג ואמזון באנגלית בלבד. סביר להניח ששאילתות בעברית יתנו תוצאות גרועות, כך שתצטרכו לתרגם את השאילתה מראש לאנגלית או לאמן שכבה עליונה.

האם כדאי לבחור בגרסה הזו או בגרסת B הקטנה?

גרסת L מובילה במדדי הדיוק בכל המבחנים, אבל דורשת כוח חישוב כבד וזיכרון כפול. אם אתם רגישים לזמני תגובה של שרת או מוגבלים בחומרה, גרסת B מספקת תוצאות קרובות מאוד במחיר משאבים נמוך בהרבה.

איך מריצים

טוענים אותו ישירות דרך ספריית open_clip או transformers בפייתון באמצעות התקנת open_clip_torch. משקל הקבצים עומד על 7.3 גיגה בייט, כך שצריך כרטיס מסך מודרני עם לפחות 12 עד 16 גיגה זיכרון כדי לייצר וקטורים בזמן אמת, במיוחד אם אתם עובדים עם אצוות גדולות.

יש למשפחה הזו גם גרסת B קטנה יותר של 203 מיליון פרמטרים, שמספקת וקטור של 768 ממדים ודורשת פחות משאבים. אם אין לכם תשתית עם GPU ייעודי שפועל באופן קבוע, אחזקת שרת כזה תהיה יקרה משמעותית בהשוואה לשליחת בקשות לשירות ענן מנוהל.

pip install -U huggingface_hub
hf download Marqo/marqo-ecommerce-embeddings-L

הרישיון

הוא מופץ תחת רישיון apache-2.0. זה רישיון פתוח שמתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים פרטיים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗