رویکردهای اخیر برای تشخیص روند از اسناد متنی و جریان های واقعی یک مطالعه

ساخت وبلاگ

آخرین مطالب

امکانات وب

Swaraj K P ، Dr. Manjula D ، Adhithyan V ، Hemnath K B ، Manish Kumar L ، 2015 ، رویکردهای اخیر برای تشخیص روند از اسناد متنی و جریان های زمان واقعی یک مطالعه ، مجله بین المللی تحقیقات و فناوری مهندسی (IJERT) TITCON-2015 (2015 (جلد 3 - شماره 16) ،

رویکردهای اخیر برای تشخیص روند از اسناد متنی و جریان های واقعی یک مطالعه

1Swaraj K P ، دکتر Manjula D ، Adhithyan V ، Hemnath K B ، Manish Kumar L

گروه علوم و مهندسی کامپیوتر ، دانشکده مهندسی ، دانشگاه آنا

چنای ، تامیلنادو ، هند

چکیده داده های بدون ساختار یا داده های نیمه ساختار یافته در قالب های مختلف حیرت انگیز است و پیش بینی می شود که این تعداد تا سال 2020 40 Zettabytes (ZB) را لمس کند. سیستم های. این نوع داده ها شامل ایمیل ، اسناد پردازش کلمه ، محتوای پیام رسانی ، فایلهای PDF ، برگه های پخش ، چندرسانه ای ، فیلم ، تصاویر دیجیتال و گرافیک ، سوابق GPS تلفن همراه و محتوای رسانه های اجتماعی است که همه عناصر دیگر را در مقیاس غول پیکر ترکیب می کند. در میان این ، داده های بدون ساختار به شکل متن بسیار مهم است و این محتوای اصلی در اسناد متنی و وب سایت های شبکه های اجتماعی است. با افزایش حجم و تنوع داده های متن بدون ساختار ، تشخیص و تجزیه و تحلیل موضوعات روند به منظور استفاده به موقع از اطلاعات از داده های بدون ساختار در قالب متن ، به موضوعات بسیار مهمتری تبدیل شده است. در سالهای اخیر پیشروی زیادی برای خودکارسازی روند تشخیص روند انجام شده است ، اما هنوز هم باید برای رسیدگی به مسئله داده های بزرگ انجام شود. این مقاله روشها و سیستمهای مختلفی را که در حال حاضر برای تشخیص روند از داده های متنی و جریان های اجتماعی مورد استفاده قرار می گیرند ، ردیابی می کند.

معدن WordwordStext ، طبقه بندی متن ، تشخیص موضوع ، تشخیص روند ، ETD ، توییتر

تشخیص موضوع و تجزیه و تحلیل روند یکی از زمینه های اشتیاق تحقیقاتی بوده است که در آن تخصص کوتاه است [1] ، [4] ، [5] ، [6] ، [7] ، [8] ، [9] ، [10]. نظارت بر روندهای تحقیق همواره نگرانی صنایع و سیاست گذاران علوم و فناوری بوده است ، زیرا به تخصیص کارآمد منابع و پیش بینی فناوری آینده کمک می کند. هنگامی که مردم شروع به نشان دادن علاقه بیشتر به آن موضوع برای یک دوره زمانی خاص کردند ، یک موضوع گرایش پیدا می کند. با توجه به مورد مجله تحقیقاتی ، هنگامی که یک موضوع برای یک زمان خاص گرایش دارد ، مقالات بیشتر و بیشتر مربوط به آن موضوع منتشر می شود. به همین ترتیب وقتی چیزی در رسانه های اجتماعی گرایش پیدا می کند ، بیشتر و بیشتر پیام های مربوط به آن رویداد ظاهر می شوند. شناسایی مباحث و روندها توسط سیاست گذاران اولویت بالایی دارد و این مباحث نیز به عنوان موضوعات داغ ، روندهای رو به بالا یا روندهای نوظهور گفته می شود. همانطور که توسط مفهوم تحت اللفظی آنها به تصویر کشیده شده است ، به نظر می رسد آنها با قدرت توجه به مرور زمان بسیار ارتباط دارند. بسیاری از محققان تلاش خود را برای تشخیص خودکار موضوع و تجزیه و تحلیل روند انجام داده اند و تکنیک ها و روش های مختلفی را ارائه داده اند. اما به دلیل مشکل داده های بزرگ ، این منطقه به موارد بیشتری نیاز دارد

تعداد تکنیک ها به منظور یافتن یک مورد مناسب برای کار در مدت زمان کوتاهی.

تعداد زیادی متن در اینترنت به صورت صفحات وب ، اسناد ، مقالات تحقیقاتی و نوع دیگر متن منتشر می شود. طبقه بندی دستی تمام این متن ، تشخیص موضوعات ، تفکیک آنها در مناطق مربوطه و یافتن زیرنویس های در حال ظهور از هر موضوع ، یک کار خسته کننده و وقت گیر برای یک فرد معمولی است. حتی اگر کسی به دنبال کمک یک متخصص باشد ، ساعت های زیادی طول می کشد تا کار را تمام کند. از این رو سیستم های استخراج موضوعی خودکار و سیستم های تشخیص روند از اهمیت بالایی برخوردار هستند ، به خصوص برای کسانی که تازه وارد عرصه تحقیق می شوند.

جالب اینجاست که در سالهای اخیر تمرکز زیادی روی شبکه های اجتماعی آنلاین بود که در آن شبکه اجتماعی به عنوان یک برنامه اینترنتی توانمند می شود. برخی از نمونه های چنین شبکه های آنلاین توییتر ، فیس بوک ، لینکدین و MySpace هستند. این شبکه های اجتماعی به سرعت محبوبیت زیادی پیدا کرده اند ، زیرا آنها دیگر محدود به محدودیت های جغرافیایی نیستند. در میان این موارد ، توییتر یک سرویس شبکه های اجتماعی و میکروبلاگینگ آنلاین بسیار رایج است که به کاربران این امکان امکان ارسال پیام های مبتنی بر متن را که معمولاً به عنوان توییت نامیده می شوند ، ارسال و به اشتراک می گذارند. تعداد زیادی از کاربران فعال در توییتر وجود دارد و توییت های روزانه تولید شده توسط آنها بسیار زیاد است. از این رو آنها به طور جمعی می توانند به طور موثری برای ارائه راه حل هایی برای چندین مشکل جالب مانند تجزیه و تحلیل احساسات عمومی و تشخیص موضوعات داغ استفاده شوند. تشخیص کلمات کلیدی محبوب به ویژه برای یافتن مسائل و روندهای داغ از توییت بسیار مهم است. اخیراً روشهای مختلفی برای ارائه رویکردهای جدید برای تشخیص روند و کلمات کلیدی ترکیبی از متن بدون ساختار ، داده های جریان توییتر و سایر وب سایت های شبکه های اجتماعی ارائه شده است. در این مقاله برخی از رویکردهای موجود برای حمایت از تحقیقات آینده در زمینه تشخیص روند موضوع بررسی شده است.

بررسی روشهای موجود

نظرسنجی از تشخیص روند نوظهور در داده های متنی کاوی

آوریل Kontostathis و همکاران. مقاله بررسی دقیق خود را در مورد تشخیص روند نوظهور در داده های متنی کاوی منتشر کرده اند [1]. این بررسی ادبیات به وضوح نشان می دهد که تلاش زیادی در این زمینه تحقیق شده است و از این رو پیشرفت های زیادی در جهت خودکار سازی روند تشخیص روندهای نوظهور حاصل شده است. تمام پروژه هایی که مورد بررسی قرار گرفتند به یک متخصص دامنه انسانی متکی هستند تا روند نوظهور از سر و صدا را در این زمینه جدا کنند

سیستم. نظرسنجی در مورد چندین سیستم که روند نوظهور در داده های متنی را تشخیص می دهند ، اشاره می کند. برخی از سیستم ها نیمه اتوماتیک هستند و برای شروع پردازش نیاز به ورودی کاربر دارند. برخی دیگر تولید کاملاً اتوماتیک از جسد ورودی بدون راهنمایی هستند. برای هر سیستم تشخیص روند نوظهور ، توضیحات مفصلی برای مؤلفه هایی از جمله ویژگی های زبانی و آماری ، الگوریتم های یادگیری ، آموزش و تولید مجموعه آزمون ، تجسم و ارزیابی ارائه شده است. ادبیات همچنین مختصراً از چندین محصول تجاری با قابلیت تشخیص روند در داده های متنی و به دنبال آن در دیدگاه صنعتی که ارتباط ابزارهای تشخیص روند را توصیف می کند ، ارائه می دهد.

. Survey همچنین مروری بر نحوه استفاده از چنین ابزارهایی ارائه می دهد.

یک روند نوظهور به عنوان یک منطقه موضوعی در نظر گرفته می شود که با گذشت زمان مورد علاقه و ابزار قرار می گیرد. به عنوان مثال ، زبان علامت گذاری گسترده (XML) به عنوان یک روند در اواسط سال 1990 ظاهر شد. اهمیت در جسد. برنامه های فعلی در ETD به دو دسته ، کاملاً اتوماتیک و نیمه اتوماتیک طبقه بندی شده اند. سیستم های کاملاً اتوماتیک یک جسد را به خود اختصاص داده و لیستی از موضوعات نوظهور را خروجی می کنند. سپس یک مرورگر انسان این مباحث را به همراه شواهد پشتیبانی شده توسط سیستم بررسی می کند تا مشخص کند که روند واقعاً در حال ظهور چیست. این سیستم ها اغلب شامل یک مؤلفه بصری هستند که به کاربر امکان می دهد موضوع را به روشی بصری ردیابی کند. شرح مفصلی از چندین سیستم ETD نیمه اتوماتیک و کاملاً اتوماتیک که برای اهداف تحقیق یا اهداف آموزشی مورد استفاده قرار می گیرند ، در این نظرسنجی شرح داده شده است. برخی از آنها در زیر ذکر شده است.

TOA (تجزیه و تحلیل فرصت های فناوری)-TOA یک سیستم تشخیص روند نیمه اتوماتیک برای تجزیه و تحلیل فرصت های فناوری است. چکیده های پایگاه داده فنی مانند Inspec ، Compendex ، حق ثبت اختراعات ایالات متحده به سیستم وارد می شوند. کلمات کلیدی بالقوه از چکیده ها توسط کارشناسان دامنه به صورت دستی استخراج می شوند. این کلمات کلیدی سپس با استفاده از اپراتورهای بولی مناسب برای تولید جستجوهای جامع و دقیق در نمایش داده شد. سپس نمایش داده شدگان به تجزیه و تحلیل فرصت های فناوری Knowbot (TOAK) وارد می شوند ، یک نرم افزار سفارشی PCKAGE همچنین به عنوان سیستم تجزیه و تحلیل فرصت های فناوری TOAS گفته می شود. Toak خلاصه سند مربوطه را استخراج می کند و تجزیه و تحلیل داده ها را با استفاده از اطلاعاتی مانند تعداد کلمات ، اطلاعات تاریخ ، اطلاعات همزمان کلمه ، اطلاعات استناد و اطلاعات انتشار برای ردیابی فعالیت در یک منطقه موضوعی ارائه می دهد. این وظیفه کاربران است که روند این روش نیمه اتوماتیک را تشخیص دهند.

سیستم Timemine s-این داده های متن رایگان را با برچسب های تاریخ صریح می گیرد و یک جدول زمانی مروری از موضوعات آماری قابل توجه تحت پوشش Corpus را ایجاد می کند. جدول زمانی برای جمع آوری داده ها به استخراج اطلاعات و تکنیک های پردازش زبان طبیعی متکی است. این سیستم از تکنیک های آزمایش فرضیه برای تعیین استفاده می کند

مهمترین مباحث در یک بازه زمانی معین. فقط مهمترین و مهمترین اطلاعات که توسط برنامه تعیین می شود به کاربر ارائه می شود. Timemines پردازش را با یک مدل پیش فرض شروع می کند که فرض توزیع یک ویژگی فقط به نرخ پایه وقوع بستگی دارد که با زمان متفاوت نیست. هر ویژگی در یک سند با مدل پیش فرض مقایسه می شود. از آزمایش آماری برای تعیین اینکه آیا ویژگی مورد آزمایش تفاوت معنی داری با آنچه مدل انتظار دارد متفاوت است. در این صورت ، این ویژگی برای پردازش آینده نگهداری می شود ، در غیر این صورت نادیده گرفته می شود. سرانجام از آستانه ای برای تعیین اینکه موضوعات مهمترین هستند استفاده می شود و اینها از طریق رابط زمانی نمایش داده می شوند

Theme River - Theme River یکی دیگر از ابزارهای تشخیص روند است که موضوعات اصلی را در یک جسد خلاصه می کند. سپس خلاصه ای از اهمیت هر موضوع را از طریق رابط کاربری گرافیکی ارائه می دهد. تغییرات موضعی با گذشت زمان به عنوان رودخانه ای از اطلاعات نشان داده شده است. این رودخانه از چندین جریان تشکیل شده است. هر جریان یک موضوع را نشان می دهد و هر موضوع توسط یک رنگ نشان داده می شود و جای خود را در رودخانه نسبت به سایر موضوعات حفظ می کند. مانند مین های TOA و TIME ، The Theme River تصور نمی کند که موضوعات ظهور است. این تجسم در نظر گرفته شده است تا اطلاعات مربوط به جسد را در اختیار کاربر قرار دهد.

PATENT MINER - سیستم معدن ثبت اختراع برای کشف روند داده های ثبت اختراع با استفاده از یک پرس و جو SQL به صورت پویا بر اساس معیارهای انتخابی توسط کاربر تهیه شده است. این سیستم به یک پایگاه داده IBM DB2 متصل است که شامل همه حق ثبت اختراعات ایالات متحده (ایالات متحده) است. دو مؤلفه اصلی برای سیستم وجود دارد. آنها با استفاده از معدن الگوی متوالی و تشخیص روند با استفاده از نمایش داده های شکل ، شناسایی عبارت هستند.

HDDI- روش جدیدی به نام سیستم نمایه سازی پویا توزیع شده سلسله مراتبی (HDDI) ارائه شده است. سیستم HDDI از پردازش متن اصلی شامل استخراج ویژگی های اطلاعات ، انتخاب زیر مجموعه ویژگی ها ، یادگیری دستگاه معدنکاری بدون نظارت و تحت نظارت و همچنین ارزیابی بسیاری از برنامه های ETD پشتیبانی می کند. وادآنها رویکرد خود را برای تشخیص روندهای نوظهور در مجموعه های متن بر اساس خوشه های معنایی تعیین شده توصیف می کنند. از سیستم HDDI برای استخراج ویژگی های زبانی از مخزن داده های متنی و تولید خوشه ها بر اساس شباهت معنایی این ویژگی ها استفاده می شود. این الگوریتم عکس فوری از وضعیت آماری یک مجموعه را در چندین نقطه از زمان می گیرد. میزان تغییر در اندازه خوشه ها و در فرکانس و ارتباط ویژگی ها به عنوان ورودی به یک شبکه عصبی استفاده می شود که موضوعات را به عنوان نوظهور یا غیر پرانرژی طبقه بندی می کند.

اطلاعات دقیق مربوط به ویژگی های زبانی و آماری ، آموزش و تولید مجموعه آزمون ، الگوریتم های یادگیری چندین سیستم ETD نیمه اتوماتیک و کاملاً اتوماتیک در بالا مورد بحث قرار گرفته است. اما نقطه ضعف این است که همه سیستم ها برای جدا کردن روندهای نوظهور از سر و صدا در سیستم به تخصص دامنه انسانی متکی هستند. از این رو حتی اگر زیاد باشد ، هنوز زمینه بزرگی برای بهبود وجود دارد

پیشرفت در جهت خودکار سازی روند کشف روندهای نوظهور انجام شده است.

تجزیه و تحلیل شبکه کلمات کلیدی

یک رویکرد جالب شبکه جدید توسط Arjun Duvvuru و همکاران ارائه شده است. برای کشف روند در حوزه تحقیق با تجزیه و تحلیل کلمات کلیدی موجود در مقالات تحقیقاتی [2]. در این رویکرد شبکه ، کلمات کلیدی به عنوان گره نشان داده می شوند. اگر در همان مقاله در شکل 1 ظاهر شوند ، یک جفت کلمه کلیدی در ارتباط هستند. به هر پیوند وزنی اختصاص داده می شود که تعداد تجویز این زوج را در مقالات مختلف نشان می دهد. سپس تجزیه و تحلیل آماری و بصری از ویژگی های ساختاری و زمانی شبکه ها انجام می شود تا درک گسترده ای از نحوه سازماندهی کلمات کلیدی و تکامل مناطق تحقیقاتی با گذشت زمان انجام شود. بر این اساس کلمات کلیدی خود را در سه دسته سازماندهی می کنند: کلمات کلیدی موضعی ، کلمات کلیدی تعریف و کلمات کلیدی متنوع. شبکه ها مطابق با مقالات منتشر شده برای یک پنجره زمانی خاص ساخته شده اند. شبکه های ساخته شده از مقالات منتشر شده در دو ویندوز زمان پی در پی مقایسه می شوند. از این طریق این تجزیه و تحلیل مقایسه ای می توان برخی از الگوهای جالب کلمات کلیدی و قدرت گره کلمات کلیدی را تشخیص داد. مناطق تحقیقاتی نوظهور از این تجزیه و تحلیل مشخص شده است. نتایج می تواند برای به روزرسانی برنامه های دانشگاهی و برنامه های درسی دوره استفاده شود.

ایده این رویکرد مبتنی بر یافته های حاصل از تجزیه و تحلیل شبکه های سیستم های مختلف است که بیشتر سیستم های پیچیده با سه ویژگی توپولوژیکی مشخص می شوند: (1) فراوانی آماری توپی ها یا گره ها با تعداد زیادی پیوندها در مقایسه با میزان متوسط درجهشبکه و (2) وجود توزیع درجه گره بدون مقیاس p (k) ، که در آن احتمال p یافتن گره درجه k از یک قانون قدرت p (k) پیروی می کند~K- (3) خصوصیات توپولوژیکی مانند درجه گره و ضریب خوشه بندی می تواند الگوهای را از اطلاعات استخراج کند. بر اساس این مشاهدات ، تحقیقات در مورد تجزیه و تحلیل شبکه کلمات کلیدی که در مقالات علمی ظاهر می شوند ، انجام می شود. هدف درک سازمان ساختاری کلمات کلیدی و شناسایی روند کلمات کلیدی با تشخیص تغییرات در خصوصیات توپولوژیکی مانند قدرت گره و توزیع وزن پیوند است. این یافته ها می تواند در آکادمی برای شناسایی زمینه های تحقیقاتی در حال ظهور استفاده شود.

عکس. 1. شبکه کلمات کلیدی

شکل 2روش 3 مرحله ای برای شناسایی روندها

درجه تعداد حادثه پیوندها یا اتصالات در یک گره است و توسط k مشخص شده است. هرچه درجه گره A بیشتر باشد ، نسبت به سایرین مرکزی تر است. قدرت یک گره شبیه به درجه است اما اولی وزن حادثه پیوندها را روی گره در نظر می گیرد. استحکام یک گره مجموع وزن همه حادثه پیوندها در آن گره است. در یک شبکه وزنی ، قدرت اندازه گیری بهتری از مرکزیت نسبت به درجه محسوب می شود. ضریب خوشه بندی C1of یک گره نسبت تعداد واقعی اتصالات بین همسایگان گره به کلیه اتصالات ممکن بین همسایگان است. بنابراین ضریب خوشه بندی اندازه گیری انسجام مجموعه ای از گره ها یا یک شبکه (ضریب متوسط خوشه بندی) است. ضریب CW خوشه ای وزنی اتصالات وزنی را به خود اختصاص می دهد. نمودار جریان مانند شکل 2. 3 روش مرحله ای را که برای شناسایی روند استفاده می شود ، نشان می دهد. در مرحله 2 ، شبکه وزنی ایجاد شده در مرحله 1 تحت تجزیه و تحلیل آماری قرار می گیرد. هدف اصلی این تجزیه و تحلیل تعیین اینکه آیا ماهیت وزن در پیوندها بین کلمات کلیدی تصادفی یا منظم است یا خیر. دلیل اصلی این امر ، کشف مکانیسم اساسی است ، در صورت وجود ، این مسئول وزن بین کلمات کلیدی است. هدف ثانویه تجزیه و تحلیل آماری ارائه یک تصویر واضح در مورد نحوه سازماندهی کلمات کلیدی (گره ها) در مجله است. این روش تجزیه و تحلیل تعیین می کند که آیا ویژگی های شبکه مانند درجه یا قدرت سلسله مراتبی از کلمات کلیدی ایجاد می کند یا خیر. به عنوان مثال ، سازماندهی کلمات کلیدی توسط مناطق موضعی را می توان از این تجزیه و تحلیل مشخص کرد. علاوه بر این ، کلمات کلیدی را می توان بر اساس نحوه اتصال آنها به یکدیگر به دسته های مختلف طبقه بندی کرد. سرانجام در مرحله 3 ، نقشه های بصری برای شبکه ها از دوره های زمانی مختلف ایجاد می شوند. این نقشه ها برای نشان دادن تغییرات در شخصیت های مختلف شبکه مانند قدرت و وزن ، کدگذاری شده اند. این در تصویربرداری از ویژگی ها و الگوهای مختلف در شبکه کمک می کند ، که به نوبه خود تجزیه و تحلیل مقایسه ای را که از طریق آن روند در مناطق تحقیقاتی شناسایی می شود ، تسهیل می کند

تشخیص روند زمانی عبارات در اسناد تحقیقاتی

روشهای متعارف فقط فرکانس کلمه را در نظر می گیرند و ماهیت اصطلاحات یا شاخص های اهمیت را به طور جداگانه در نظر نمی گیرند. در این مقاله ، هیدنائو آبه و همکاران. یک روش بهبود یافته برای تشخیص روند عبارات با ترکیب روش های استخراج مدت ، شاخص های اهمیت اصطلاحات و روش های تجزیه و تحلیل روند ارائه داد [3]. اگرچه شاخص های اهمیت اصطلاحات فنی نقش مهمی در یافتن الگوهای ارزشمند از مختلف دارند

با توجه به جسد ، این سیستم شاخص های اهمیت چندگانه از اصطلاحات اسناد هر دوره را محاسبه می کند. برخی از شاخص های مشهور ضریب TF-IDF و Jaccards هستند.

In the following experiments, the threshold for FLR is set up as FLR >1. 0 برای استخراج اصطلاحات از کل مجموعه اسناد. سپس ، تکنیک تحلیل رگرسیون خطی به منظور تشخیص میزان روندهای موجود بر اساس دو شاخص اهمیت اعمال می شود.

درجه مدت به شرح زیر محاسبه می شود

اسناد ، تغییرات زمانی آنها صریح نیست

با روشهای معمولی درمان می شود. از آنجا که این روش ها

در هر روش به شاخص خاص بستگی دارد ، آنها نیستند

قوی در تغییر شرایط. به منظور تشخیص محکم روند موقت قابل توجه اصطلاحات فنی در مجموعه داده های متنی ، روشی بر اساس تغییرات زمانی در چندین شاخص اهمیت با فرض شاخص های اهمیت اصطلاحات به عنوان مجموعه داده ارائه می شود. پس از تشخیص روند زمانی ، مقایسه بین روندهای نوظهور عبارات فنی با برخی از عبارات نوظهور ارائه شده توسط یک متخصص دامنه برای بررسی مسابقه انجام می شود.

مراحل اصلی این رویکرد عبارتند از

استخراج اصطلاح فنی در یک جسد

محاسبه شاخص های اهمیت

نمای کلی از روش پیشنهادی در زیر نشان داده شده است

شکل 3معماری تشخیص روند از جسد

روش استخراج مدت بر فرکانس مجاور اسمهای مرکب CN است. این روش شامل تشخیص اصطلاحات فنی با استفاده از مقادیر زیر برای هر نامزد CN است:

جایی که x میانگین نقاط زمان m و y میانگین هر شاخص اهمیت برای دوره است. به طور همزمان ما Int (t) رهگیری هر اصطلاح t را به شرح زیر محاسبه می کنیم

نتایج برای اصطلاحات استخراج شده به صورت خودکار با استفاده از درجه و رهگیری هر اصطلاح محاسبه می شود. دو روند زیر تعیین می شود

مرتب سازی درجه در سفارش صعودی

مرتب سازی رهگیری به ترتیب نزولی

مرتب سازی درجه در سفارش نزولی

مرتب سازی رهگیری به ترتیب صعودی

سنجش مباحث گرایش در توییتر

اطلاعات غنی و به موقع در مورد رویدادهای دنیای واقعی از همه نوع توسط رسانه های اجتماعی و خبری آنلاین تولید می شود. با این حال، به دلیل گستردگی گسترده پایگاه کاربر و حجم زیاد داده های موجود، نیازمند تلاش قابل توجهی برای فیلتر کردن اطلاعات برای بررسی موفقیت آمیز موضوعات و رویدادهای مرتبط است. بنابراین، تشخیص موضوع پرطرفدار یک بلوک اساسی برای نظارت و خلاصه کردن اطلاعات منشأ گرفته از منابع اجتماعی است. مقاله ارائه شده توسط لوکا ماریا آیلو و همکاران. شش روش تشخیص موضوع را در سه مجموعه داده توییتر مربوط به رویدادهای مهم مقایسه می کند [11]. یکی از روش های جدید تشخیص موضوع پیشنهاد شده بر اساس هم روندی n-gram و رتبه بندی موضوع df-idft به طور مداوم بهترین عملکرد را در مقایسه با تکنیک های مرسوم به دست می آورد. روش های آزمایش شده در این مقاله سه کلاس مختلف را پوشش می دهند: مدل های احتمالی (تخصیص دریکله نهفته)، تشخیص و ردیابی موضوع کلاسیک (رویکرد رایج سند محوری) و روش های محوری ویژگی. در طول این سری از روش ها، چهار رویکرد جدید توسعه یافته است. از جمله روش هایی که از مفهوم کاوی مجموعه آیتم های مکرر استفاده می کنند. به طور خاص، آن

L 1 نشان داده شده است که روشی که از n-gram co-

FLR(CN ) f (CN ) ((FL(Ni ) 1)(FR(Ni ) 1)) L

در جایی که f(CN) به معنای بسامد نامزدهای CN است، و FL(Ni) و FR(Ni) فرکانس سمت راست و چپ هر اسم Ni را نشان می دهد. پس از تعیین شرایط در

وقوع (به جای یک گرم) و رتبه بندی موضوع df-idft به طور مداوم بهترین روش عملکرد در بین روش های آزمایش شده است. df-idft پیشنهادی امتیازی برای تشخیص ترکیدگی است که می تواند به طور قابل توجهی در تعیین سریع ترین موضوعات در حال ظهور کمک کند. 3 مجموعه داده منتخب حوزه های سیاست را پوشش می دهند (انتخابات اولیه سه شنبه فوق العاده ایالات متحده

مارس 2012 و انتخابات ریاست جمهوری ایالات متحده در نوامبر 2012) و ورزش (فینال جام حذفی انگلیس).

مشارکت های قابل توجه را می توان به شرح زیر خلاصه کرد:

یک مطالعه مقایسه ای از طیف گسترده ای از روش های تشخیص موضوع در سه مجموعه داده بزرگ توییتر در یک سناریوی سنجش رویداد در دنیای واقعی ارائه شده است. ایده اصلی استفاده از مجموعه داده های مختلف، مقایسه عملکرد الگوریتم ها در حوزه های مختلف است که ویژگی های خاص خود را دارند.

تجزیه و تحلیل در مورد اینکه چگونه عواملی مانند نوع داده های ورودی (به عنوان مثال بازه زمانی، وسعت موضوع) و تکنیک های پیش پردازش می توانند بر کیفیت نتایج تشخیص موضوع تأثیر بگذارند، انجام می شود.

در میان روش های آزمایش شده، الگوریتم جدید پیشنهادی که n-gram را با رتبه بندی df-idft ترکیب می کند، بهترین عملکرد را دارد و از سایر تکنیک های پیشرفته بهتر عمل می کند.

شش روش مقایسه شده است

تخصیص دیریکله نهفته (LDA)

تشخیص موضوع محوری سند (Doc-p)

تشخیص موضوع محوری مبتنی بر نمودار (GFeat-p)

استخراج الگوی مکرر (FPM)

استخراج الگوی مکرر نرم (SFPM) و

استفاده از n-gram برای توییتر منطقی به نظر می رسد، زیرا تعداد زیادی از به روز رسانی های وضعیت فقط کپی یا بازتوییت پیام های قبلی هستند، بنابراین n-gram های مهم اغلب مکرر هستند. یک روش انتخاب ویژگی جدید استفاده می شود که در آن تغییر فراوانی اصطلاحات در طول زمان به عنوان منبع مفید اطلاعات برای شناسایی موضوعات در حال ظهور در نظر گرفته می شود. هدف اصلی این رویکرد یافتن موضوعات نوظهور در جریان های پست با مقایسه فرکانس های اصطلاحی از زمان فعلی با فرکانس های بازه های زمانی قبلی است. یک معیار جدید پیشنهاد شده است که زمان را به نمره کلاسیک معرفی می کند. از داده های تاریخی برای جریمه کردن موضوعاتی استفاده می شود که در گذشته شروع شده اند و هنوز در حال حاضر محبوب هستند و بنابراین موضوعات جدیدی را تعریف نمی کنند. این رویکرد تمام کلمات کلیدی را از پست های مجموعه ایندکس می کند. شاخص های کلیدواژه که با استفاده از Lucene پیاده سازی می شوند در بازه های زمانی مختلف سازمان دهی می شوند. این شاخص علاوه بر تک کلمات کلیدی، بیگرام ها و تریگرام ها را نیز در نظر می گیرد. پس از ایجاد نمایه، امتیاز df-idft برای هر n گرم از شکاف زمانی فعلی i بر اساس فرکانس سند آن برای این شکاف زمانی محاسبه می شود و با لگاریتم میانگین فرکانس های سند آن در زمان t قبلی جریمه می شود. اسلات ها

فرآیند ، رتبه بندی N-Grams بر اساس نمرات DF-IDFT آنها ایجاد می شود. یک N-Gram اغلب بسیار آموزنده نیست ، اما گروهی از آنها اغلب جزئیات جالب یک داستان را ارائه می دهند. بنابراین ، یک الگوریتم خوشه بندی برای گروه بندی بیشترین تعداد N-Grams به خوشه ها استفاده می شود که هر یک نمایانگر یک موضوع واحد هستند. خوشه بندی مبتنی بر فاصله بین N-Grams یا خوشه های N-Grams است. از مجموعه مسافت ها ، فرض بر این است که آستانه ای که بیش از آستانه فاصله نیستند ، همان موضوع را نشان می دهند. شباهت بین دو گرم به عنوان کسری از پستهایی که حاوی هر دو آنها است تعریف می شود. در ابتدا Evry N-Gram به خوشه Singleton خود اختصاص داده شده و سپس یک الگوریتم خوشه ای سلسله مراتبی متوسط گروه استاندارد را دنبال می کند تا به طور تکراری نزدیکترین جفت خوشه را پیدا و ادغام کند. هنگامی که یک خوشه N-gram به دیگری پیوست ، شباهت های خوشه جدید به سایر خوشه ها به عنوان میانگین شباهت های خوشه های ترکیبی محاسبه می شود. خوشه بندی تا زمانی که شباهت بین نزدیکترین خوشه های غیرقانونی در زیر یک آستانه ثابت قرار می گیرد ، تکرار می شود و مجموعه نهایی خوشه های موضوع را برای شکاف زمانی مربوطه تولید می کند. در آزمایشات ، از آستانه شباهت 0. 5 استفاده می شود ، به این معنی که دو گرم n باید در بیش از 50 ٪ از همان توییت ها ظاهر شوند تا به همان موضوع تعلق داشته باشند. این فرض در این حالت قوی تر است زیرا فقط پست برای یک شکاف زمانی خاص در نظر گرفته می شود. بنابراین بیشتر احتمال دارد که خوشه های N-Gram که شباهت آنها بالاتر از آستانه است ، همان موضوع را نشان دهند. سرانجام ، خوشه ها با توجه به بالاترین امتیاز N-Grams موجود در خوشه رتبه بندی می شوند. این معیار رتبه بندی براساس این فرض است که هر نمره خوشه باید با نمره نماینده ترین N-Gram در خوشه همراه باشد ، زیرا این خوشه عمدتاً از پست های حاوی آن تشکیل شده است.

تشخیص زودرس روند توییتر-رویکرد غیر پارامتری

تشخیص روند در توییتر بیشتر بر اساس تجزیه و تحلیل سری های زمانی انجام می شود. در رویکرد پارامتری، یک پارامتر پرش می گوید p از یک پنجره فعالیت تخمین زده می شود و تشخیص روند بر اساس این است که آیا p از یک آستانه فراتر رفته است یا خیر. در اینجا یک مدل برای نوع فعالیت ایجاد می شود، مثلاً الگویی که می تواند قبل از اینکه یک موضوع به عنوان روند اعلام شود رخ دهد. این نوع روش پارامتریک نامیده می شود زیرا پارامتر p را از داده ها تخمین می زند. اما چنین مدلی اغلب نمی تواند تمام الگوهایی را که می توانند قبل از تبدیل شدن موضوع به موضوع قبل از ترند شدن، ثبت کنند. گاهی اوقات الگوی قبلی می تواند یک صعود تدریجی، گاهی ثابت و یک پرش بزرگ باشد و همچنین ممکن است یک سری پرش های کوچک باشد که منجر به یک پرش بزرگ می شود. بنابراین در این موارد مدل های مختلفی برای هر روند مورد انتظار ایجاد می شود

الگویی که یک راه حل غیر ممکن است.

یک روش کارآمد مبتنی بر داده های غیر پارامتری توسط اسنیکولوف و شاه برای تشخیص زودهنگام روندهای توییتر [12] پیشنهاد شده است. این روش مبتنی بر این فرض است که افرادی که در شبکه های اجتماعی فعالیت می کنند

علاوه بر این، عاملی در نظر گرفته می شود که اهمیت اسم های مناسب (افراد، مکان ها و سازمان ها را با استفاده از یک شناسه دهنده موجودیت نام گذاری شده استاندارد بالا ببرد، زیرا آنها کلیدواژه های ضروری در بیشتر داستان های مورد بحث هستند).

قابل پیش بینی. معمولاً در یک سایت شبکه اجتماعی، اگر شخص x دوستانی داشته باشد که همه دوستان یک فرد y هستند، این احتمال وجود دارد که y دوست x باشد. اگر بسیاری از دوستان xs در مورد یک رویداد صحبت می کنند، وجود دارد

احتمال زیادی وجود دارد که شخص x نیز در مورد همان صحبت کند. بنابراین در اینجا فرض بر این است که فقط چند الگوی مکرر می تواند وجود داشته باشد که می تواند قبل از اینکه یک موضوع ترند شود رخ دهد. در این روش، داده ها مدل را تعریف می کنند. داده ها در مورد الگوهایی که قبل از روندها و الگوهایی که نیستند یاد می گیرند. سپس به جای ایجاد یک مدل از داده ها، از خود داده برای تعیین اینکه آیا یک روند خواهد بود یا خیر استفاده می شود.

اول از همه فعالیت یک موضوع جدید ردیابی می شود. یک الگوی مشاهده شده برای یک دوره زمانی یافت می شود و با الگوهای فعالیت مثال R از مباحثی که در گذشته گرایش پیدا می کردند و انجام نمی شود ، مقایسه می شود. این بدان معنی است که R می تواند R- و R+ را تنظیم کند که از هر کدام 500 الگوهای گرایش و غیر منتخب تشکیل شده است. این مقایسه بر اساس یک طرح رای گیری است. هر یک از الگوهای فعالیت مثال به الگوی مشاهده شده بر اساس عملکرد رای گیری رای می دهد. وزن هر رأی به فاصله اقلیدسی بین R و S بستگی دارد. سرانجام تمام آراء گرایش و غیرقانونی خلاصه می شوند و نسبت این موارد محاسبه می شود. اگر نسبت بیشتر از 1 باشد ، موضوع روند و اگر کمتر از 1 باشد ، نیست.

مزایای این روش است

محاسبات ساده است زیرا فقط باید فاصله محاسبه شود

محاسبات از راه دور را می توان موازی کرد

هیچ مدلی برای تشخیص استفاده نمی شود. این الگوریتم قادر به تشخیص روند توییتر پیش از الگوریتم روند ارائه شده توسط توییتر تقریباً 79 ٪ از زمان با نرخ خطای 95 ٪ (95 ٪ نرخ مثبت واقعی و 4 ٪ نرخ مثبت کاذب) بود.

تشخیص روند از فیس بوک

در حال حاضر فیس بوک بزرگترین سایت شبکه های اجتماعی آنلاین با بیش از 800 میلیون کاربر فعال و پس از آن توییتر با 280 میلیون کاربر تخمین زده می شود. بسیاری از مطالب به صورت آنلاین در قالب های مختلف به اشتراک گذاشته می شوند. اخبار ، نظرات و وضعیت های زمان واقعی از طریق فیس بوک به صورت آنلاین به اشتراک گذاشته می شود. ماهیت عمومی این پیام های وضعیت از فیس بوک در تکنیک پیشنهادی Irena Pletikosa Cvijikj و همکاران استفاده می شود. برای تشخیص روند از فیس بوک که ادعا می شود اولین در نوع خود است [13]. آنها با کمک یک الگوریتم جدید ، مباحث گرایش را در الف) رویدادهای مختل کننده ب) مباحث محبوب و ج) روال روزانه طبقه بندی می کنند. سرانجام ویژگی های دسته بندی های پیشنهادی از نظر توزیع و انتشار اطلاعات به منظور افزایش درک روندهای نوظهور در فیس بوک مورد تجزیه و تحلیل و مقایسه قرار می گیرند.

Facebook Graph API از طریق نمایش یکنواخت از اشیاء موجود در نمودار (به عنوان مثال ، افراد ، پست ها ، صفحات و غیره) دسترسی به نمودار اجتماعی فیس بوک را فراهم می کند. در این مطالعه اشیاء پست مورد توجه بودند. هر شیء پست حاوی اطلاعات زیر است: (1) جزئیات محتوا برای پست (پیام ، نام ، شرح ، توضیحات) ، (2) کاربر فیس بوک که پیام را ارسال کرده است ، (3) نوع پیام مطابق تعریف توسط فیس بوک ، یعنی وضعیت، عکس ، پیوند ، و غیره ، (4) زمان ایجاد ، (5) برنامه مورد استفاده برای به اشتراک گذاری پست و غیره. همه این عناصر در یک پایگاه داده رابطه ای برای تحقیقات بیشتر ذخیره شدند. تجزیه و تحلیل زبانی در 3 مجموعه پست استخراج شده انجام شد. میانگین

تعداد جملات در یک پست تقریباً 1. 4 است. در عین حال ، میانگین تعداد کلمات تقریباً 18 است ، در مقایسه با 16 کلمه در یک توییت کمی بیشتر است. با این حال ، با نگاهی به مجموعه داده کامل ، در حالی که میانگین طول پست در شخصیت با نتایج ما تفاوت معنی داری ندارد (108) ، حداکثر طول 754 کاراکتر یافت شد که به طور متوسط با تقریباً 10 جمله و 122 کلمه مطابقت دارد. تشخیص روند معمولاً بر اساس (1) شناسایی موضوع است ، و (2) تشخیص خوشه ای. فرمول TF-IDF برای محتوای به اشتراک گذاشته شده در فیس بوک به دلیل محدود بودن طول پست های فیس بوک قابل استفاده نیست ، که این امر باعث کاهش ارزش این اصطلاح می شودمؤلفه فرکانس در معادله. از این رو از مفهوم یک سند ترکیبی در این روش استفاده شده است. مفهوم یک سند ترکیبی ، مجموعه ای از پست های p = ، به دست آمده در یک بازه زمانی t را نشان می دهد ، که مربوط به فاصله برای واکشی پست های فیس بوک در یک سیستم نزدیک به زمان واقعی است. هر فریم زمانی T یک مجموعه داده جداگانه را که توسط یک لیست وزنی جداگانه شرح داده شده است ، نشان می دهد. محاسبه TF-IDF متناسب با این نوع رویکرد اسناد ترکیبی اصلاح شده است.

نتایج شناسایی موضوع را در لیست سفارش داده شده از مهمترین اصطلاحات در جسد قرار دهید. مرحله بعدی این است که اصطلاحاتی را که متعلق به همان موضوع است ، جمع کنید. خوشه بندی پست در دو مرحله (1) خوشه بندی با توزیع و (2) خوشه بندی با وقوع همزمان انجام می شود. خوشه بندی توسط توزیع ترکیبی از مقایسه اصطلاح وزن و تقاطع اسناد مرتبط است. هدف از بین بردن وقایع متعدد N-Grams مشابه با طول های مختلف متعلق به همان پست ها است. پس از انجام گروه بندی ، ما گروه ها را با N-GRAM با حداکثر طول جایگزین می کنیم زیرا حاوی حداکثر اطلاعات در مورد موضوع است. خوشه بندی با وقوع همزمان بر این فرض است که اصطلاحاتی که اغلب در پست های مشابه ظاهر می شوند متعلق به همان موضوع هستند. این مرحله برای گروه بندی اصطلاحاتی که از نظر معنایی مشابه نیستند و متعلق به پست های مختلف هستند استفاده می شود ، اما هنوز هم به همان موضوع اشاره می کند.

ارزیابی بر اساس دقت و فراخوان انجام شد. 10 آزمایش انجام شد که هر یک از 1000 پست از فواصل زمانی مختلف جمع آوری و پردازش و بررسی نتایج به دست آمد. رویکرد سعی کرد تا تفاوت ها را از نظر توزیع از طریق شکل و حجم اطلاعات مشترک شناسایی کند. رویکرد همچنین از اندازه گیری سرعت و مقیاس توزیع اطلاعات در فیس بوک به عنوان نشانگر امکان استفاده از فیس بوک به عنوان رسانه خبری استفاده کرد. توزیع از نظر حجم پست های به اشتراک گذاشته شده در فیس بوک در مورد یک موضوع خاص ، نشانگر روشنی از سطح مورد علاقه کاربران برای موضوع مرتبط است. علاوه بر این ، شکل توزیع نشانگر موضوعی است که متعلق به دسته روالهای روزانه است که همیشه در مکالمه در برخی از سطح نسبتاً مساوی وجود دارد ، یا اگر مربوط به رویدادی باشد که در یک نقطه خاص از زمان اتفاق می افتد. درک تفاوت بین توزیع هایی که مربوط به کارهای روزمره و مباحث مردمی از یک طرف است ، و توزیع های مربوط به وقایع مختل کننده از طرف دیگر ، به ما امکان آموزش سیستم ها را برای تشخیص روند اتوماتیک می دهد تا بتوانیم بین این انواع مختلف تفاوت قائل شویمروند

مقایسه با توزیع تجمعی پست ها در طول روز نشان می دهد که قله های مباحث محبوب با قله های موجود در نمودار توزیع پست روزانه مطابقت دارد ، در حالی که قله های روزمره برعکس است. در سطح عمومی تر ، کارهای روزمره معمولاً مربوط به یک دوره خاص در یک روز است ، به عنوان مثال ، شب بخیر فقط در عصرها به عنوان یک موضوع گرایش ظاهر می شود. علاوه بر این ، این دو موضوع در کل بازه زمانی وجود دارد و روند آن را نشان می دهد ، و نشانگر یک موضوع محبوب است ، اما چیز جدیدی نیست.

نتیجه گیری و کار آینده

تکنیک های تشخیص روند به طور مرتب بر روی داده های متن استاتیک و داده های جریان زمان واقعی انجام می شود. در این مقاله مطالعه ای در مورد روشهای اخیر برای تشخیص روند در داده های متن و جریان های زمان واقعی ارائه شده است. ابتدا مروری بر یک نظرسنجی موجود ارائه شد که جلوه بیشتری از روشهای ETD موجود را ارائه می دهد. دو روش اخیر برای تشخیص روند از متن بدون ساختار به تفصیل شرح داده شده است. روش شبکه یک شبکه کلمه کلیدی برای تشخیص روند ایجاد می کند در حالی که روش دیگر روند را بر اساس شاخص های مهم محاسبه می کند. 3 روش برای تشخیص روند از داده های رسانه های اجتماعی نیز مورد بحث قرار گرفت. این روشها روند داده های پخش مستقیم را از شبکه های اجتماعی آنلاین مانند توییتر و فیس بوک تشخیص می دهند. در اینجا تکنیک ها با متن استاتیک متفاوت است زیرا بیشتر روند مبتنی بر وقایع در شبکه های اجتماعی است. مفاهیم ارائه شده توسط روشهای مختلف به طور خلاصه همراه با ارتباط هر روش توصیف شده است. سهم مهم این است که این نظرسنجی در ثبت نام روشهای موجود برای تشخیص روند تحت دسته بندی هر دو اسناد استاتیک و جریان های زمان واقعی متمرکز شده است. این مقاله همچنین یک مرجع کارآمد و سریع برای کسانی که علاقه مند به انجام تحقیقات در زمینه تشخیص روند در متون هستند ، ارائه می دهد. کار آینده ارائه یک مطالعه کامل برای ETD در داده های جریان واقعی و پیشنهاد یک چارچوب یکپارچه است.

آوریل Kontostathis ، Leon M Galitsky ، William M Pottenger ، Somaroy ، Daniel J Phelps ، بررسی تشخیص روند نوظهور در داده های متنی کاوی

Arjun Duvvuru ، Sagar Kamarthi ، Sivarit Sultosanee ، تحت پوشش روندهای تحقیق: تجزیه و تحلیل شبکه کلمات کلیدی در مقالات علمی. نهمین کنفرانس مشترک بین المللی در مورد علوم کامپیوتر و مهندسی نرم افزار (JCSSE) 2012.

Hidenao Abe ، Shusaku Tsumoto با استفاده از شاخص های اهمیت در اسناد تحقیقاتی ، مجموعه مقالات کنفرانس بین المللی IEEE در مورد سیستم ها ، انسان و سانبرنتیک سان آنتونیو ، TX ، ایالات متحده - اکتبر 2009 ، الگوهای زمانی عبارات فنی را تشخیص می دهد.

Masahiro Terachi ، Ryosuke Saga و Hiroshi Tsuji ، به رسمیت شناختن روند در مقالات ژورنالی با استفاده از متن ، کنفرانس بین المللی IEEE در مورد سیستم ها ، انسان و سایبرنتیک 8 تا 11 اکتبر 2006 ،

Daehoon Kim ، Daeyong Kim ، Seungmin Rho و Eenjun Hwang ، با استفاده از ویژگی های داده های جریان توییتر مجله بین المللی Smart Home Vol. 7

شماره 1 ، ژانویه 2013

Levent Bolelli ، Eyda Ertekin ، c. موضوع لی گیلز و تشخیص روند در مجموعه های متن با استفاده از تخصیص Dirichlet نهفته ، مجموعه مقالات 31 کنفرانس اروپایی در مورد تحقیقات IR در مورد پیشرفت در بازیابی اطلاعات Springer-Verlag برلین ،

هایدلبرگ ، 2009 ص 776 - 780

Xiaodong Wang ، خوان وانگ ، روشی برای تشخیص موضوع داغ در وبلاگ ها با استفاده از مجله نرم افزار N-Gram Model ، Vol. 8 ، نه. 1 ، ژانویه 2013

Teng-Kaifan ، Chia-Huichang ، بررسی روندهای فنی تکاملی از مقالات تحقیقات دانشگاهی مجله علوم اطلاعات و مهندسی اطلاعات 26 ، 2010 ، صص 97-117

Manish Gupta ، Jing Gao ، Chengxiang Zhai ، Jiawei Han پیش بینی روند محبوبیت آینده وقایع در سیستم عامل های میکروبلاگی

، Proc of Asist ، ، بالتیمور ، دکتر ، ایالات متحده. 28-31 اکتبر 2012

Aleksandre Lobzhanidze ، Wenjun Zeng ، Paige Gentry and Angelique Taylor ، رسانه های اصلی در مقابل رسانه های اجتماعی برای روند پیش بینی موضوع یک مطالعه تجربی دهمین سالانه IEEE CCNC

لوکا ماریا آیلو ، جورجیوس پتکوس ، کارلوس مارتین ، دیوید کورنی ، سیمئون پاپادوپولوس ، رایان اسکارا ، ایس گواکر ، ایوانیس کاممپاتیاریس ، عضو ارشد ، IEEE و Alejandro Jaimes ، Sensing Trending در توییتر. معاملات IEEE در Multimedia ، جلد. 15 ، نه. 6 ، اکتبر 2013

Irena pletikosa cvijikj ، فلورین میشاهلز ، روند نظارت در کنفرانس بین المللی IEEE در فیس بوک نهم در مورد محاسبات قابل اعتماد ، خودمختار ، 2011

آموزش کار در فارکس...
ما را در سایت آموزش کار در فارکس دنبال می کنید

برچسب : نویسنده : Mihayloo بازدید : <-PostHit-> تاريخ : چهارشنبه 10 اسفند 1401 ساعت: 16:28