GPT
E

Ecom-niverse

קוד פתוח

thebajajraapache-2.02025-08-28

  • ecommerce
  • e-commerce
  • retail
  • marketplace
  • shopping

המאגר מרכז טקסטים מאתרי קניות מתוך רשת האינטרנט הפתוחה. הוא מיועד למי שמאמן מודלי שפה וצריך הבנה חדה של עולם הקמעונאות, מוצרים ומחירים.

  • 4,038הורדות בחודש
  • 17לייקים

מה זה

הנתונים נגזרו מתוך FineFineWeb, מאגר פתוח שמכיל מעל 4.4 טריליון טוקנים באנגלית המחולקים לכחמישים תחומים. היוצרים בודדו מתוכו 15 קטגוריות רלוונטיות לקניות. שש קטגוריות נלקחו ישירות כפי שהן: Fashion בנפח 37 גיגה בייט, Beauty בנפח 37 גיגה בייט, Celebrity בנפח 28 גיגה בייט, Movie בנפח 26 גיגה בייט, Photo בנפח 15 גיגה בייט וקטגוריית Painting בנפח 2 גיגה בייט.

תשע הקטגוריות האחרות עברו סינון עמוק כדי להפריד טקסטים מסחריים ממאמרי תוכן וחדשות כלליים. הרשימה המסוננת כוללת את Hobby בנפח 114 גיגה בייט, News בנפח 66 גיגה בייט, Health בנפח 66 גיגה בייט, Entertainment בנפח 64 גיגה בייט, Travel בנפח 52 גיגה בייט, Food בנפח 22 גיגה בייט, Automotive בנפח 19 גיגה בייט, Sports בנפח 12 גיגה בייט ותחום Music and Dance בנפח 7 גיגה בייט.

תהליך הסינון התבסס על דגימת מאות אלפי פריטים מכל תחום ותיוגם באמצעות מודל Phi-4, שנבדק מול Llama3-70B כדי לוודא עקביות. על גבי התיוגים האלה אומנו מסווגי fastText ייעודיים לכל תחום, שהשיגו רמת דיוק של מעל 80 עד 90 אחוזים בבדיקות ההערכה וסיננו את שאר הטקסטים ברמת השורה.

מתאים ל

  • אימון מקדים למודל שפה

    הרחבת הידע של מודל כללי על מונחי מסחר ומחירים באנגלית לפני התאמה.

  • זיהוי ישויות במוצרים

    אימון מסווגים לחילוץ שמות מותגים, מפרטים ומחירים מטקסט לא מובנה.

  • סיווג טקסטים בעולם הקמעונאות

    בניית מודלי מיון לקטלוג מוצרים על בסיס נתונים מתחומים כמו רכב ואופנה.

איפה זה נופל

הטקסטים כולם באנגלית בלבד, כך שלמי שמחפש לפתור בעיות מסחר בעברית אין פה מענה ישיר. הנתונים מתבססים על סינון אוטומטי של דפי אינטרנט, מה שאומר שעלולים להישאר חלקי עמודים שבורים או ניסוחים לא קוהרנטיים. בנוסף, ההגדרה של מה נחשב תוכן קמעונאי נשענת על שיקול הדעת של Phi-4 ומסווגי fastText שנשענו עליו, ולכן תיתכן החמצה של מבני מוצר מורכבים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי מלא באימון ובהרצה. הדרישה המרכזית היא שימור הקרדיט והודעת הרישיון המקורית בקוד או בתיעוד.

האם הדאטהסט כולל עברית?

לא, המאגר מסווג רשמית כדאטה באנגלית בלבד. המקור שלו מבוסס על FineFineWeb המרכז טקסט אנגלי, ולכן הוא לא רלוונטי לאימון ישיר בעברית.

איך המידע הזה נאסף בפועל?

החוקרים לקחו נתונים גולמיים של CommonCrawl מתוך FineFineWeb וחילקו אותם לתחומים. לאחר מכן הם תייגו דגימות באמצעות Phi-4, בדקו בעזרת Llama3-70B, ואמנו מסווגי fastText שסיננו את הטקסטים.

באיזה פורמט הקבצים מגיעים?

המאגר מורכב מ־20,530 קבצים פנימיים המחולקים לתקיות לפי נושאים. הקבצים שמורים בפורמט jsonl.zst דחוס ומחייבים ספריות מתאימות לפריקה וקריאה.

איך טוענים

המידע מחולק לתיקיות לפי תחומים, כמו תיקיית automotive, ופרוס על פני 20,530 קבצים בפורמט jsonl.zst הדורש פתיחה עם zstandard. המאגר פתוח לחלוטין להורדה ישירה בחיבוק הפנים ללא צורך בהרשאה מקדימה. הטיפול בכמות כזו של קבצים דורש סקריפט הזרמה ישיר או נפח אחסון מקומי משמעותי לפריקה של מאות גיגה בייטים דחוסים.

from datasets import load_dataset

ds = load_dataset("thebajajra/Ecom-niverse")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי ומחקר חופשי, כולל אימון מודלים פנימיים או חיצוניים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לפתוח קוד מקור של מוצרים שנבנו בעזרתו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗