אגרגטור תוכן מותאם אישית: RSS, עיבוד API, הסרת כפילויות, ML, התאמה אישית

איסוף ידני של תוכן ממקורות מרובים גוזל שעות ומוביל לכפילויות בפיד. אנחנו בונים מאגדי תוכן סוהריים: אנו הופכים לאוטומטיים את ניתוח ה-RSS וה-API, מסננים חזרות ומגדירים פידים מותאמים אישית. הצוות שלנו מוביל את הפרויקט מהארכיטקטורה ועד לתמיכה, ומבטיח פעילות אמינה וסקאלביליות לצד העסק שלכם.

פיתוח ותחזוקה של כל סוגי האתרים:

אתרי מידע או יישומי אינטרנט
אתרי תדמית, דפי נחיתה, אתרי חברה, קטלוגים מקוונים, חידונים, אתרי קידום, בלוגים, מקורות חדשות, פורטלי מידע, פורומים, אגרגטורים
אתרי מסחר אלקטרוני או יישומי אינטרנט
חנויות מקוונות, פורטלי B2B, שווקים, בורסות מקוונות, אתרי קאשבק, בורסות, פלטפורמות דרופשיפינג, מנתחי מוצרים
יישומי אינטרנט לניהול תהליכים עסקיים
מערכות CRM, מערכות ERP, פורטלים ארגוניים, מערכות ניהול ייצור, מנתחי מידע
אתרי שירות אלקטרוני או יישומי אינטרנט
פלטפורמות מודעות, בתי ספר מקוונים, בתי קולנוע מקוונים, בוני אתרים, פורטלים לשירותים אלקטרוניים, פלטפורמות אירוח וידאו, פורטלים נושאיים

אלה רק חלק מהסוגים הטכניים של אתרים שאנו עובדים איתם, ולכל אחד מהם יכולים להיות מאפיינים ופונקציונליות ספציפיים משלו, וכן ניתן להתאים אותם לצרכים ולמטרות הספציפיים של הלקוח.

השירותים שאנו מציעים
מציג 1 מתוך 1כל 2062 השירותים
אגרגטור תוכן מותאם אישית: RSS, עיבוד API, הסרת כפילויות, ML, התאמה אישית
מורכב
מ- 2 שבועות עד 3 חודשים

הכישורים שלנו:

שאלות נפוצות

העבודות האחרונות

  • פיתוח אתר חברה B2B ADVANCE
    פיתוח אתר חברה B2B ADVANCE
    1501
  • פיתוח אפליקציית ווב עבור FEEDME
    פיתוח אפליקציית ווב עבור FEEDME
    1344
  • פיתוח אתר עבור BELFINGROUP
    פיתוח אתר עבור BELFINGROUP
    1052
  • פיתוח חנות מקוונת לחברת FURNORO
    פיתוח חנות מקוונת לחברת FURNORO
    1306
  • פיתוח אפליקציית ווב עבור Enviok
    פיתוח אפליקציית ווב עבור Enviok
    1049
  • פיתוח אתר לחברת FIXPER
    פיתוח אתר לחברת FIXPER
    1033

איסוף תוכן מעשרות מקורות ידנית לוקח שעות של העתקה, בדיקת כפילויות ומיון. אגרגטור תוכן אוטומטי פותר זאת: הוא מנתח RSS ו-API, מסנן כפילויות, מקטלג ומציג פיד מותאם אישית. אנו מתכננים ומיישמים צינור נתונים כזה עבור הפרויקט שלך — מהארכיטקטורה ועד לפריסה. במהלך השנים השקנו יותר מ-10 אגרגטורים עבור פורטלי מדיה וארגונים, והפחתנו את איסוף התוכן הידני ב-80%. חיסכון בתקציב מגיע ל-60% הודות לאוטומציה.

פרויקט טיפוסי כולל 30–50 הזנות RSS, 5–10 מקורות API, ומספר אתרים לגרידת נתונים. כל מקור דורש מתאם נפרד עם טיפול במגבלות קצב ושגיאות. אנו משתמשים בתורי משימות של Bull על Redis, המאפשרים עיבוד מקבילי של עד 100 מקורות ללא אובדן נתונים. במקרה של כשל, משימה מנוסה אוטומטית עם השהיה אקספוננציאלית עד 3 פעמים. ניטור דרך Grafana עוקב אחר אחוז ההצלחה של כל מקור.

סכימת צינור הנתונים

שלב כלי תיאור
מתזמן cron מפעיל איסוף בלוח זמנים כל N דקות
מביא נתונים Bull/BullMQ תור משימות לכל מקור עם ניסיונות חוזרים
מנתח rss-parser, Cheerio, Playwright חילוץ נתונים מ-RSS, HTML, SPA
מנרמל קוד מותאם מיפוי שדות לפורמט אחיד
מסנן כפילויות SimHash, MinHash זיהוי כפילויות מדויקות וכמעט מדויקות
אחסון PostgreSQL אחסון ראשי
מאינדקס Elasticsearch / Meilisearch חיפוש טקסט מלא וסינון

למה סינון כפילויות הוא קריטי

כפילויות מופיעות כאשר אותו סיפור מתפרסם על ידי מספר מקורות. אנו מיישמים שלוש שיטות:

שיטה עיקרון יעילות
התאמת URL מדויקת בדיקת ייחודיות של URL רק URLs זהים
גיבוב כותרת גיבוב של כותרת מנורמלת כותרות זהות
SimHash / MinHash זיהוי כמעט כפול מקורב טקסטים דומים (סף ניתן להגדרה)

SimHash יעיל פי 3 מגיבוב מדויק לזיהוי טקסטים דומים, ומפחית תוצאות שגויות ל-5%. עם כוונון נכון, סינון הכפילויות מסנן 95% מהכפילויות. עבור פרויקט מדיה אחד עם 50 הזנות RSS ו-10 מקורות API, הקמנו צינור נתונים שמעבד 500 מאמרים ביום, וצמצם את העבודה הידנית מ-4 שעות ל-15 דקות. מידע נוסף על SimHash.

from simhash import Simhash

def is_duplicate(text1: str, text2: str, threshold: int = 5) -> bool:
    h1, h2 = Simhash(text1.split()), Simhash(text2.split())
    return h1.distance(h2) < threshold

באילו כלי ניתוח אנו משתמשים?

ניתוח RSS הוא פשוט. האתגר הוא חילוץ טקסט נקי בעת גרידת נתונים:

  • Readability (Mozilla) – מסיר ניווט ופרסומות;
  • Trafilatura (Python) – מחלץ טקסט עם זיהוי שפה;
  • Playwright – עבור SPA הדורשים רינדור JavaScript מלא.

כל מתאם לוקח 1–2 ימים להקמה, כולל טיפול בשגיאות ומגבלות קצב. מהירות הניתוח מגיעה ל-10 מאמרים בשנייה לכל מתאם. תיעוד Readability: Readability.

קיטלוג ותיוג

סיווג אוטומטי לפי נושא:

  • התאמת מילות מפתח: כללים כמו "שקל" → "פיננסים";
  • סיווג ML: מבוסס fastText או BERT לתיוג רב-תגיתי. דיוק ML מגיע ל-90% על נתונים מסומנים. עיבוד 1000 מאמרים בדקה הוא מהירות ריאלית עבור fastText.

זיהוי שפה: from simhash import Simhash def is_duplicate(text1: str, text2: str, threshold: int = 5) -> bool: h1, h2 = Simhash(text1.split()), Simhash(text2.split()) return h1.distance(h2) < threshold (Python) או langdetect (Node.js).

איך פועלת התאמה אישית של הפיד

המשתמש מנהל מסננים:

  • מקורות וקטגוריות מופעלים/מושבתים;
  • מינויים למילות מפתח;
  • מילות מפתח שליליות להחרגת נושאים.

אופציונלית, דירוג אלגוריתמי: סינון שיתופי המבוסס על היסטוריית קריאה של משתמשים דומים. זה מגביר מעורבות ב-30% לפי הנתונים שלנו.

עמידה בדיני זכויות יוצרים

האגרגטור מציג רק תצוגות מקדימות (פסקת פתיחה + קישור), מכבד franc ומגבלות קצב. מודל השימוש ההוגן מאפשר קטעים קצרים אך לא פרסום מחדש מלא. אנו תמיד נותנים קרדיט למקור ולכותב.

מה כלול בעבודה

  • ניתוח מקורות ועיצוב ארכיטקטורה;
  • יישום צינור נתונים: ניתוח → נרמול → סינון כפילויות → אחסון → אספקה;
  • הקמת אינדוקס ב-Elasticsearch/Meilisearch;
  • קיטלוג (כללים או ML);
  • התאמה אישית (מסננים ודירוג);
  • תיעוד API ופאנל ניהול;
  • בדיקות ובדיקות עומס;
  • פריסה עם ניטור (Grafana, Sentry).

לוח זמנים

שלב משך
MVP (10–20 RSS, פיד, חיפוש, קטגוריות) 4–6 שבועות
סט תכונות מלא (ML, גרידת נתונים, התאמה אישית, API) 3–5 חודשים

העלות נקבעת באופן אישי לאחר ביקורת. הזמינו ביקורת על המקורות שלכם — נעריך תוך יום אחד. אנו מבטיחים עמידה בלוחות זמנים וסודיות. הצוות שלנו השיק יותר מ-10 אגרגטורים. צרו קשר כדי לדון בפרויקט שלכם.