در طول همه گیر COVID-19 ، بسیاری از مطالعات تحقیقاتی برای بررسی تأثیر شیوع این بخش در بخش مالی ، به ویژه در مورد ارزهای رمزپایه انجام شده است. رسانه های اجتماعی ، مانند توییتر ، به عنوان یک شاخص معنی دار در پیش بینی قیمت بیت کوین (BTC) نقش مهمی ایفا می کنند. با این حال ، یک شکاف تحقیقاتی در تعیین استراتژی بهینه پردازش بهینه در توییت های BTC برای تهیه یک مدل پیش بینی دقیق یادگیری ماشین برای قیمت های بیت کوین وجود دارد. در این مقاله استراتژی های مختلف پردازش متن برای همبستگی نمرات احساسات متن توییتر با قیمت بیت کوین در طول همه گیر COVID-19 تهیه شده است. ما تأثیر عملکردهای مختلف پیش پردازش ، ویژگی ها و طول زمان داده ها را بر نتایج همبستگی بررسی می کنیم. از بین 13 استراتژی ، ما می دانیم که تقسیم جملات ، حذف برچسب های خاص توییتر یا ترکیب آنها به طور کلی همبستگی نمرات احساسات و نمرات قطبیت حجم را با قیمت بیت کوین بهبود می بخشد. قیمت ها فقط با نمرات احساسات نسبت به زمان های کوتاهتر ارتباط دارند. انتخاب استراتژی بهینه پیش پردازش ، مدلهای پیش بینی یادگیری ماشین را برای دستیابی به دقت بهتر در مقایسه با قیمت های واقعی سوق می دهد.
1. معرفی
مطالعات تحقیقاتی اخیر پدید آمده است که شامل تأثیر COVID-19 در بازار مالی ، از جمله ارزهای رمزنگاری شده است [1،2،3،4،5،6،7،8]. نشان داده شده است که بیت کوین پناهگاه امن نیست [1،2]. همبستگی بین بیت کوین و بورس در [3،4] مشاهده می شود. در [5] ، نویسندگان تجزیه و تحلیل همبستگی پویا را انجام دادند که نشان می داد بیت کوین نمی تواند خطر فوق العاده دم سهام ایالات متحده را محافظت کند. همبستگی بین بیت کوین و داده های روزانه مرگ و میر جهانی COVID-19 در [6] بررسی شده است. رفتار گله دار در بازار cryptocurrency در [7] مورد بررسی قرار گرفته است. ارتباط بین نوسانات بورس سهام و پاسخ های سیاست در مورد شیوع COVID-19 در [8] مورد مطالعه قرار گرفته است. کار قبلی قبل از همه گیر از الگوریتم های مختلف یادگیری ماشین برای پیش بینی قیمت بیت کوین استفاده کرده است. در [9] ، آرتی جین و همکاران. تلاش برای پیش بینی قیمت های بیت کوین و Litecoin دو ساعت قبل بر اساس احساسات بیان شده در توییت های فعلی. آنها بررسی کردند که آیا عوامل اجتماعی می توانند قیمت ارزهای رمزپایه را پیش بینی کنند. آنها از یک مدل رگرسیون خطی چندگانه (MLR) برای پیش بینی قیمت متوسط بیهوده از تعداد توییت های مثبت ، خنثی و منفی جمع آوری شده در هر دو ساعت استفاده کردند. Symeonidis و همکاران. با مقایسه اهمیت تکنیک های مختلف پیش پردازش برای تجزیه و تحلیل احساسات توییت ها [10]. آنها از چهار الگوریتم یادگیری ماشین مختلف ، رگرسیون خطی ، Beoulli Laïve Bayes ، دستگاه بردار پشتیبانی خطی و یک شبکه عصبی حلقوی برای طبقه بندی توییت ها به عنوان احساسات مثبت ، منفی یا خنثی استفاده کردند. آنها 16 روش پیش پردازش مختلف را در انزوا آزمایش کردند. آنها توصیه می کنند با استفاده از لماتیزاسیون ، جایگزینی نگارشی مکرر ، تعویض انقباضات یا حذف اعداد. آنها پنج روش تأثیرگذار را برای استفاده در یک ثانیه شناسایی کردند. بر اساس نتایج آنها ، آنها پیشنهاد کردند که URL ها و ذکرهای کاربر را جایگزین کنید ، جایگزین انقباضات ، جایگزین کردن نگارشی مکرر و لیمماتیزاسیون برای یک مدل طبقه بندی شبکه عصبی شوید. ابراهیم و همکاران.[11] یک مدل پیش بینی کننده با استفاده از مدل های Autoregression Bayesian ، قیمت BTC را ارائه داد. در TAN و KASHEF [12] ، یک مطالعه مقایسه ای بین مدلهای مختلف پیش بینی BTC انجام شده است ، که نشان دهنده راندمان چند لایه Perceptron (MLP) در پیش بینی قیمت بیت کوین است. هیچ یک از مطالعات تحقیقاتی فوق تأثیر احساسات بیان شده در مورد بیت کوین را در سیستم عامل های رسانه های اجتماعی مانند توییتر در هنگام شیوع COVID-19 بررسی نکرده است.
پیش پردازش توییت ها یک چالش مهم در تهیه و ایجاد یک مدل پیش بینی حاد است. تغذیه داده های متن که به خوبی با بیت کوین با یک مدل پیش بینی ارتباط ندارند ، پیش بینی مناسب رفتار بیت کوین را نمی دهد. هدف از این مقاله ، انجام یک فرهنگ لغت آگاه و آگاهی کامل و احساسات (Vader) مبتنی بر تجزیه و تحلیل احساسات مبتنی بر توییت های BTC در دوره COVID-19 برای شناسایی نقش استراتژی های مختلف پیش پردازش در پیش بینی قیمت بیت کوین است. تجزیه و تحلیل احساسات شامل تبدیل متن توییت به نمره احساسات است که نماینده احساسات آن است. چنین کاری برای Vader ، یک ابزار تجزیه و تحلیل احساسات واژگان و مبتنی بر قانون مناسب است که می تواند با نحوی که معمولاً در رسانه های اجتماعی اتخاذ می شود ، مقابله کند. ما 13 استراتژی مختلف پردازش را برای توییت های BTC تهیه کردیم. برای رتبه بندی اثربخشی استراتژی پیش پردازش ، یک مقدار همبستگی کلی ، متوسط همبستگی ویژگی (AFCM) ، ساخته شده است. برای هر استراتژی ، مقادیر همبستگی کلیه ویژگی های بهینه با ارزش مطلق آنها به طور متوسط انجام می شود. استراتژی های پیش پردازش بهینه با استفاده از سیستم های امتیاز دهی Vader اندازه گیری می شوند. از نمره Vader برای مطابقت با روند واقعی قیمت BTC استفاده می شود. در بین همه استراتژی ها ، مشخص شد که تقسیم جملات ، از بین بردن برچسب های خاص توییتر یا ترکیب آنها به طور کلی همبستگی نمرات احساسات و نمرات قطبیت حجم را با قیمت بیت کوین بهبود می بخشد. بقیه این مقاله به شرح زیر سازماندهی شده است: در بخش 2 ، بحث در مورد تجزیه و تحلیل احساسات ارائه شده است. بخش 3 کارهای مرتبط با احساسات توییت را ارائه می دهد. در بخش 4 ، تجزیه و تحلیل احساسات کامل با استفاده از امتیاز دهی توییت BTC در دوره COVID-19 مورد بحث قرار گرفته است. بخش 5 مقاله را نتیجه می گیرد و مسیرهای تحقیق آینده را ارائه می دهد.
2. تجزیه و تحلیل احساسات
در این بخش ، برخی از روشهای شناخته شده تجزیه و تحلیل احساسات ، از جمله Vader [13] ، Word2VEC [14] ، TFIDF [15] و N-Grams [16] مورد بحث قرار گرفته است.
2. 1فرهنگ لغت آگاه و دلایل حساس (Vader)
Vader یک ابزار تجزیه و تحلیل احساسات واژگان و قاعده است که می تواند کلمات ، اختصارات ، عامیانه ، شکلک ها و ایموجی ها را که معمولاً در رسانه های اجتماعی یافت می شود ، اداره کند [13]. این به طور معمول بسیار سریعتر از الگوریتم های یادگیری ماشین است ، زیرا نیازی به آموزش ندارد [13،17]. هر بدن از متن یک بردار از نمرات احساسات با قطب های منفی ، خنثی ، مثبت و مرکب تولید می کند [13]. قطب های منفی ، خنثی و مثبت به صورت عادی بین 0 تا 1 نرمال می شوند. قطبیت مرکب را می توان به عنوان یک اندازه گیری کل از سایر احساسات دیگر تصور کرد ، که عادی شده بین 1 (منفی) و 1 (مثبت) است.
2. 2Word to Vector (Word2Vec)
در روش WORD2VEC ، کلمات جاسازی شده به عنوان بردارهای ساخته شده از اعداد با ارزش واقعی طراحی شده اند [14]. این بردارها با ساختن کلمات مشابه ، هر دو ترتیب نحوی را حفظ می کنند ، دارای بردارهای مشابه و منظم معنایی بین جفت های کلمه از طریق جبر بردار هستند. به عنوان مثال ، کلمه بردار برای "انسان" که از کلمه بردار برای "پادشاه" جدا شده و به کلمه بردار برای "زن" اضافه شده است ، چیزی شبیه به وکتور کلمه "ملکه" تولید می کند. چنین بردارهایی راهی برای ترجمه کلمات به اعداد برای الگوریتم های یادگیری ماشین قطار ضمن حفظ روابط بین کلمات فراهم می کنند. Word2VEC در ابتدا توسط Tomas Mikolov و همکاران ساخته شد.[14] برای تولید بردارهای کلمه ای با کیفیت بالا با کارآمدتر از وسایل معمولی. یک شبکه عصبی کم عمق به جلو وزن هایی را با لایه های ورودی ، طرح ریزی و خروجی به عنوان بردارهای کلمه ای آموزش می دهد. از دو معماری شبکه مختلف ، Cbow و Skip-Gram برای تولید بردارهای کلمه استفاده شد. Cbow برای حدس زدن یک کلمه هدف از کلمات مجاور در متن بهینه شده است ، در حالی که Skip-Gram برای حدس زدن کلمات مجاور اطراف یک کلمه هدف بهینه شده است.
2. 3فرکانس اسناد فرکانس وارونه (TF-IDF)
رویکرد TFIDF کلمات کلیدی را برای هر سند در مجموعه ای از اسناد پیدا می کند [15،16،18]. این یک عدد را به هر کلمه در یک سند بر اساس اینکه چند بار در آن سند ظاهر می شود و چه تعداد از اسناد از آن استفاده می کنند ، اختصاص می دهد."اصطلاح فرکانس" یک کلمه تعداد دفعاتی است که کلمه در یک سند ظاهر می شود ، در حالی که "فرکانس سند" تعداد اسنادی است که حاوی آن کلمه است [18]."فرکانس اسناد معکوس" یک کلمه ، لگاریتم طبیعی تعداد کل اسناد است که بر اساس "فرکانس سند" کلمه تقسیم می شوند. به هر کلمه با ضرب "فرکانس اصطلاح" کلمه توسط "فرکانس سند معکوس" خود ، نمره TFIDF اختصاص داده می شود.
2. 4گرام
N-Gram مدلی است که شناسایی همه گروه های کلمات مجاور N در یک متن از متن را توصیف می کند [16]. به عنوان مثال ، تمام سخنان سه قلو مجاور در جمله "مریم کمی بره" "مری داشت" ، "کمی" و "کمی بره" داشت. این گروه بندی ها به عنوان trigrams شناخته می شوند. با این حال ، گروه بندی ها را می توان برای هر اندازه عدد صحیح تعریف کرد. Unigrams ، یا گروه های یک کلمه ای ، شامل "مریم" ، "HAD" ، "A" ، "LITTLE" ، و "بره" می شود. Bigrams یا جفت کلمات شامل "مریم" ، "یک" ، "کمی" و "بره کوچک" بود. استفاده از N-Grams بزرگتر در یک فرهنگ لغت احساسات ممکن است به بهبود صحت تجزیه و تحلیل احساسات در هنگام انجام مذاکرات کمک کند.
3. کار مرتبط و پس زمینه
در [19] ، همبستگی بین تجزیه و تحلیل احساسات با استفاده از توییت های فعلی بیت کوین و نوسانات قیمت بیت کوین آینده مورد بررسی قرار گرفت. فقط بر اساس تغییرات احساسات ، مدل پیش بینی ساده لوحانه با پیش بینی های بسیار کمی به دقت 83 ٪ دست می یابد. نویسندگان در [20] نشان می دهند که احساسات توییتر و حجم پیام می تواند نوسانات قیمت چندین ارز رمزنگاری را پیش بینی کند ، در حالی که حساب های ربات توییتر می توانند اطلاعات نادرست رمزنگاری را گسترش دهند. یک الگوریتم Vader اصلاح شده ، احساسات توییت از 9 ارز رمزنگاری را به عنوان خرید ، نگهداری یا فروش طبقه بندی می کند. نتیجه تجربی آنها نشان داد که فواصل روزانه احساسات و حجم پیام های توییتر پیش بینی کننده های قوی تر از خرید نسبت به فروش است. T. R. Li et al.[21] سعی کرده است نشان دهد که احساسات توییتر در پیش بینی تغییرات قیمت رمزنگاری کمک می کند. آنها برای پیش بینی تغییرات قیمت ، یک مدل درخت رگرسیون تقویت کننده شیب شدید (XGBOOST) را آموزش داده اند تا تغییرات قیمت را پیش بینی کنند. شش متغیر ساعتی برای احساسات وزنی مثبت ، منفی ، خنثی ، بدون وزنه ، و حجم معاملات از مجموعه داده های جمع آوری شده تولید شد. در [22] ، از الگوریتم تجزیه و تحلیل احساسات Vader برای اختصاص هر توییت یک نمره احساساتی مرکب بر اساس چگونگی مثبت ، منفی یا خنثی بودن سخنان آنها استفاده شد. امتیاز نهایی احساسات در تعداد پیروان توییتر ، لایک ها و بازتوییت های مرتبط با هر توییت به وجود آمده است. قیمت بسته شدن فعلی بیت کوین ، نمره احساسات نهایی و میانگین حرکت 100 نقطه داده آخر به عنوان متغیرهای ورودی برای مدل استفاده شد. C. Kaplan و همکاران.[23] تحقیق کرد که آیا شایعات و گمانه زنی ها در رسانه های اجتماعی می تواند بر ارزهای رمزنگاری شده و تغییرات قیمت تأثیر بگذارد. دقیقاً ، آنها وابستگی بین قیمت های ناپایدار رمزنگاری را با احساسات توییتر ارزیابی کردند. شش ارز رمزپایه انتخاب شده Agrello ، Bread ، Bytecoin ، Digibyte ، Doge Coin و ICO بود. تجزیه و تحلیل رگرسیون برای آزمایش وابستگی قیمت های رمزنگاری روزانه در احساسات روزانه توییتر انجام شد. مقادیر F و R 2 برای هر رمزنگاری محاسبه شد. نان و Bytecoin کمترین نمره R 2 را نشان داد ، در حالی که سکه های دیگر دارای نمرات بالاتر از 0. 22 بودند. Agrello ، Bytecoin و ICO همه نمرات F برجسته زیر 0. 05 داشتند. آنها نتیجه گرفتند که برخی از ارزهای رمزپایه ناپایدار ممکن است وابستگی به احساسات توییتر را نشان دهند. Sailunaz و Alhajj [24] توصیه های کاربر را برای کاربران یا موضوعات توییتر ایجاد کردند.
آنها نشان دادند که تجزیه و تحلیل متن کامل از توییت ها بهتر از کاوش در متن کامل از توییت ها با فقط اسم ، صفت ، افعال و قید (NAVA) است. کار آنها شامل ارائه نمرات احساسات ، شبکه پاسخ و یک شبکه پیرو از توییت ها برای برآورد توصیه های یادگیری ماشین است. یک طبقه بندی کننده ساده لوح ، ثابت کرد که بهتر از یک دستگاه بردار پشتیبانی (SVM) یا یک جنگل تصادفی (RF) تحت اعتبار سنجی متقاطع K است [25]. نمرات احساسات متن کامل حداقل 5 ٪ بهتر از متن NAVA در زیر اعتبار سنجی متقابل 3- ، 5- و 10 برابر بود. بهترین امتیاز 66. 86 ٪ بود که از 10 برابر اعتبارسنجی یک طبقه بندی کننده ساده لوح در متن کامل بدست آمد. Hanjia Lyu و همکاران.[26] کاربران توییتر را مشخص کرد که هنگام ذکر COVID-19 در توییتر از اصطلاحات بحث برانگیز استفاده می کنند و الگوریتم های مختلف یادگیری ماشین را برای طبقه بندی کاربران آموزش داده اند.
4- تجزیه و تحلیل کامل احساسات توییت های BTC در دوره COVID-19
این مقاله با هدف شناسایی اصلاحات در متن توییت در طول پیش پردازش به گونه ای است که نمرات احساسات حاصل از آن به بهترین وجه با قیمت های بسته شدن بیت کوین در ارتباط است. ما روشهای مختلفی برای پیش پردازش متن برای به ثمر رساندن Vader ایجاد کردیم و آنها را بر روی توییت های کوتاه و تمام طول آزمایش کردیم.
4. 1جمع آوری داده ها
ما با تهیه یک اسکرابر توییت سفارشی با استفاده از API توییتر ، توییت هایی را برای تجزیه و تحلیل احساسات جمع کردیم. ما تصمیم گرفتیم داده ها را به سه دلیل اصلی به صورت دستی جمع آوری کنیم. تمام مجموعه داده های رایگان آنلاین موجود شامل دوره همه گیر COVID-19 نیست. از تمام اسکریپرات وب جلوگیری شد زیرا ممکن است محدودیت های API توییتر را دور بزنند. این محدودیت ها برای محافظت از کاربران توییتر بود. ما قوانین Twitters [27،28] را دنبال کردیم ، و با استفاده از کتابخانه Tweepy برای دسترسی به API توییتر ، اسکرابر توییت خود را در پایتون کدگذاری کردیم [29]. در آزمایشات ما ، روش جمع آوری مجموعه ای از توییت های BTC را در دوره COVID-19 به دست آورد. انتخاب توییت شامل فیلتر کردن توییت توسط مجموعه ای از کلمات کلیدی انتخاب شده دستی بود. توییت هایی که شامل هر کلمه کلیدی مربوط به بیت کوین ("بیت کوین" ، "بیت کوین" ، "بیت کوین" ، "بیت کوین" ، "BTC" ، "XBT" و "Satoshi") یا هر هشتگ نمادهای تیکت بیت کوین ("#XBT" است.، "$ XBT" ، "#BTC" و "$ BTC") جمع آوری شد. متن توییت خام و جدول زمانی آنها ذخیره شد. Timestamps با وضوح زمانی به نزدیکترین ثانیه ارائه شد. از آنجا که توییتر توییت بیش از 140 کاراکتر را کوتاه می کند ، نسخه کامل آن توییت ها نیز جمع آوری شد [30،31،32]. در مجموع 4،169،709 توییت از 8:47 صبح ، 22 مه تا 11:59 بعد از ظهر ، 10 ژوئیه جمع آوری شد. حجم توییت های جمع آوری شده برای هر تاریخ بر اساس اینکه داده های درخواست شده چند ساله است ، متفاوت است ، همانطور که در شکل 1 نشان داده شده است. قیمت بیت کوین به صورت رایگان از API CryptoCompare بدست می آید [32]. آنها داده های تاریخی باز از اطلاعات باز ، پایین ، پایین و بسته و حجم (OHLCV) را با وضوح زمانی از هر دقیقه ارائه می دهند [33]. به طور دقیق ، داده های بیت کوین بیش از داده های ساعتی به دست آمد تا نقاط داده کافی برای تجزیه و تحلیل ارائه شود. حدود 71472 دقیقه از نقاط داده از 22 مه تا 10 ژوئیه جمع آوری شد ، در حالی که جمع آوری قیمت های ساعتی نزدیک به 1191 نقطه داده را فراهم می کرد. سپس Timestamps از قیمت بیت کوین و داده های OHLCV ذخیره شد. به نظر می رسد داده های OHLCV ضبط شده از (cryptocompare. com) در حال نوسان است که هنوز قیمت ها هنوز هم بودند. داده ها تا 33 ساعت به گذشته (بر اساس تست های ما) ارائه شد. از یک روال جمع آوری دو روزه برای جایگزینی هرگونه قیمت اخیر (نزدیک به شروع دوره جمع آوری) استفاده شد که مطابق با هر قیمت قدیمی تر از دوره جمع آوری بعدی است.
The “no sw” function in Figure 3 tokenizes text into words and removes any stopwords that VADER’s dictionary does not use. Removing stop words from text requires a tokenized text into a list of words. The tokenization of text into words involves separating continuous blocks of alphabetical characters from the rest of the text. Blocks of continuous whitespace mark our word boundaries, split by Python’s split () function [35]. Removing all non-alphabetical characters would solve this; however, this would remove some punctuation, all emojis, and all emoticons that VADER could recognize for sentiment analysis [36]. VADER allows exclamation marks ”!” and question marks ”?”, which affect the sentiment score [36]. Our tokenization algorithm, as shown in Figure 4, groups characters from every tokenized word into “alphabetical”, “punctuation”, or “emoticon” blocks of characters. Ideally, these three blocks of characters would allow VADER to join each of them to preserve most of the text VADER can recognize. To distinguish punctuation from emoticons, any characters in the set $ [email protected]&_*#>:`)]|%;~4. 2پیش پردازش داده ها
پیش پردازش از هر توییت به یک نمره قطبیت متوسط و حجم قطبیت توییت در دقیقه بر روی متن انجام شد. این شامل ترکیب سه عملکرد اصلی تمیز کردن متن با عنوان "تمیز" ، "تقسیم" و "بدون SW" است. به ترتیب ، آنها مدیریت حذف نحو خاص توییت ، تقسیم متن را به جملات و حذف کلمات توقف. توابع "تمیز" و "تقسیم" در سفارشات مختلف ، با و بدون حضور عملکرد "NO SW" در پایان مورد آزمایش قرار گرفتند. هر سه عملکرد پیش پردازش بر تجزیه و تحلیل احساسات Vader از متن به روش های مختلف تأثیر گذاشت. هرکدام این پتانسیل را داشتند که به طور قابل توجهی به Vader کمک کند تا جنبه دیگری از احساسات را از متن ضبط کند. عملکرد "تمیز" شخصیت ها و کلمات ناخواسته را که به طور خاص در سکوی توییتر استفاده می شود ، مانند لینک ها ، شماره ها و نحو خاص توییت با استفاده از عبارات منظم حذف کرد. حذف برای حفظ ایموجی ها و شخصیت های شکلک ممکن برای استفاده در آنالایزر احساسات Vader استفاده شد. قبل از برداشتن هرگونه کاراکتر الفبایی ، علامت بیضی "..." از انتهای متن توییت کوتاه شده بود که در 140 کاراکتر قرار گرفته است. علاوه بر این ، اشخاص HTML مانند "& amp" ؛به شخصیت های معادل UTF-8 مانند "&" تبدیل شدند. سپس لینک ها با شخصیت های "http" یا "www" شروع می شوند. حذف شدنداعداد ، همراه با هر نماد ، نگارشی یا واحدهای کنار آنها حذف شدند. سرانجام ، نحو خاص توییت برداشته شد. این نحو شامل ذکر نام های کاربری فرم "Useame" ، هشتگ های فرم "#HashTag" و شروع بازتوییت های فرم "RTuseame" است. پس از اتمام مرحله تمیز کردن همانطور که در شکل 2 نشان داده شد ، هر توییت توسط کلمات ، فضای سفید ، ایموجی ها و سایر شخصیت های غیر آلفانوم نشان داده شد. با توجه به دشواری در ایجاد یک بیان منظم برای تشخیص همه شکلک ها در واژگان وادر [34] ، این شخصیت ها بدون تغییر باقی مانده اند. بنابراین ، متن "تمیز" سعی در ترک هر آنچه را که Vader می تواند در تجزیه و تحلیل احساسات بدون تغییر استفاده کند ، ترک کند.
-، ([+^"تنها بخشی از یک شکلک هستند که در کنار شخصیت دیگری در همان مجموعه اتفاق بیفتند.
برای تعیین اینکه آیا برخی از توابع پیش پردازش در پیش بینی قیمت بیت کوین نقش دارند ، خروجی این توابع در ترکیب های مختلف توسط Vader به ثمر رسید. تمام عملکردهای تمیز کردن متن مرحله پیش پردازش در 5 مسیر مختلف ترکیب شدند. نمرات متن در مراحل میانی هر مسیر ثبت شد تا مشخص شود آیا یک عملکرد بهبودی در نتایج دارد یا خیر. توابع "تمیز شده" ، "تقسیم NLTK" ، "Split Regex" و "No SW" نشان داده شده در شکل 5 برای ارائه پنج مسیر مختلف ترکیب شده اند. عملکرد "No SW" به عنوان آخرین مرحله در هر مسیر رفتار می شد ، زیرا هیچ عملکرد دیگری به توکن سازی کلمه نیاز ندارد. از آنجا که Vader می تواند برای متن به هر طول اعمال شود ، توابع "تمیز شده" ، "NLTK Split" و "Regex Split" متنی با طول متفاوت تولید می کنند. توابع "تمیز" و "تقسیم" در مسیرهای مختلف با هم تعویض شدند. هر دو عملکرد "تقسیم" ، "تمیز" و هر دو عملکرد "بدون SW" پس از آن اعمال شد. عملکرد "تمیز" می تواند یک عملکرد "تقسیم" داشته باشد که قبل از مرحله "بدون SW" استفاده شده است. ترکیبات پیش پردازش ما نمرات 13 مرحله میانی (از 5 مسیر مختلف) را اندازه گیری کرده است ، همانطور که در شکل 6 نشان داده شده است. توییت های متن و مجموعه داده های پیش پردازش شده برای دسترسی و بارگیری در [37] در دسترس هستند.
4. 3احساسات Vader و قیمت BTC
در این بخش از همبستگی پیرسون بین نمرات Vader هر یک از 13 مرحله پیش پردازش میانی در طول زمان با قیمت بسته شدن BTC در دقیقه استفاده شده است. از آنجا که توییت ها خیلی بیشتر از یک بار در دقیقه ایجاد می شوند ، ما همه نمرات توییت ها را به دو روش در هر دقیقه در یک ویژگی در هر دقیقه جمع کردیم. اول ، ما به طور متوسط نمرات منفی ، خنثی ، مثبت و مرکب از همه توییت ها در هر دقیقه. این استراتژی به ما این امکان را می دهد تا ویژگی های امتیاز دهی Vader از نمرات قطبیت احساسات را در حدود 1 حفظ کنیم. رویکرد دوم شامل شمارش تعداد (یا حجم) توییت هایی است که متناسب با یک کلاس قطبیت احساسات کلی هستند. هر توییت را می توان با داشتن قطبیت کلی منفی ، خنثی یا مثبت بر اساس نمره احساسات مرکب طبقه بندی کرد. ما هر متنی را با نمره احساساتی وادر مرکب در زیر 0. 05 - به عنوان یک قطب منفی کلی ، بالاتر از 0. 05 ، در نظر می گیریم که دارای قطبیت مثبت کلی است. نمرات دیگر دارای قطبیت خنثی کلی هستند. این 4 ویژگی نمره احساسات Vader و چهار ویژگی حجم احساسات را تولید می کند [13].
از آنجا که هشت ویژگی مختلف برای هر یک از 13 مرحله پیش پردازش میانی در کل مجموعه داده ها به دست آمده است ، قیمت بیت کوین در هر دقیقه در برابر 104 سری زمانی منحصر به فرد از اعداد مرتبط بود. نمره همبستگی پیرسون برای هر سری زمانی در یک ماتریس مپیکت 8 × 8 نمایش داده می شود ، همانطور که در شکل 7 نشان داده شده است. این ماتریس همبستگی نشان دهنده مقادیر همبستگی پیرسون انواع سری زمانی با قیمت بیت کوین است. هر سری زمانی از تمام طول متن توییت ارسال شده بین 22 مه ، 8:47 صبح و 23 مه ، ساعت 8:47 صبح ساخته می شد. برای رتبه بندی اثربخشی استراتژی های مختلف پیش پردازش ، یک مقدار همبستگی کلی ، میانگین همبستگی ویژگی (AFCM) ، برای هر ردیف ماتریس ساخته شد. برای هر استراتژی ، مقادیر همبستگی هر هشت ویژگی با ارزش مطلق آنها به طور متوسط برای تولید یک مقدار واحد در مناسب ترین ستون به طور متوسط انجام می شود. در حالی که چند الگوی از ماتریس دیده می شود ، در صورت استفاده از یک زمان کوتاه تر از داده یا تاریخ شروع سری زمانی متفاوت ، می توانند تغییر کنند. ما ماتریس همبستگی را با نمودار همبستگی بیش از طول مجموعه داده های مختلف در بخش بعدی بهبود می بخشیم.
4. 4انواع ویژگی ها و همبستگی
برای پاسخ به تفاوت در همبستگی به دلیل طول مدت داده های مورد استفاده ، از زیر مجموعه های داده استفاده کردیم. تعداد روزهای متوالی داده ها متفاوت و با قیمت بیت کوین مربوطه با همان زمانبندی اتفاق می افتد. ما از این مقدار به عنوان مقدار همبستگی زیر مجموعه یاد خواهیم کرد. چندین زیر مجموعه منحصر به فرد از داده ها وجود دارد که به همان تعداد روزها می پردازند. به عنوان مثال ، زیر مجموعه 3 روز داده می تواند از 22 مه ، 23 مه ، 24 مه ... 5 ژوئیه ، 6 ژوئیه و 7 ژوئیه آغاز شود. بنابراین ، ما به طور متوسط مقادیر همبستگی را از تمام زیر مجموعه های منحصر به فرد داده ها با همان طول و تاریخ شروع متفاوت به طور متوسط گرفتیم. مقدار حاصل مستقل از تاریخ شروع آن است (به همان اندازه که می تواند با مدت زمان محدود داده های جمع آوری شده باشد). میانگین مقادیر همبستگی همه زیر مجموعه های یکسان با تاریخ های مختلف شروع باید هرگونه قطب همبستگی (مثبت یا منفی) را به ما نشان دهد که اکثر زیر مجموعه ها نشان می دهند. این به عنوان قطبیت همبستگی زیر مجموعه (ASCP ، خط متراکم در شکل) شناخته می شود. مقدار همبستگی می تواند مثبت ، منفی یا میانگین باشد. بنابراین ، ما ممکن است پنهان کنیم که مقادیر همبستگی چقدر بزرگ بوده و ASCP را صفر می کند. برای کاهش این اثر ، ما همچنین می توانیم مقادیر همبستگی مطلق همه زیر مجموعه های یکسان با تاریخ های مختلف شروع را به طور متوسط نشان دهیم تا بزرگی یا قدرت مقادیر همبستگی را نشان دهیم. این به عنوان متوسط همبستگی زیر مجموعه (ASCM ، خط جامد در همه شکل) شناخته می شود. ASCP و ASCM به عنوان نمودارهای خط در برابر طول داده ها در کلیه زیر مجموعه ها ترسیم می شوند. هشت شکل زیر ASCP و ASCM را برای ویژگی های مشترک تولید شده از 13 استراتژی پیش پردازش نشان می دهد. یک نمودار طرح رتبه بندی عملکرد در این ارقام گنجانده شده است تا هر استراتژی را از بهترین تا بدترین با استفاده از ASCM ، برای تمام طول داده های زیر مجموعه ، رتبه بندی کند. رتبه اول با بهترین عملکرد و بزرگترین ASCM مطابقت دارد ، در حالی که رتبه سیزدهم با بدترین عملکرد و کوچکترین ASCM مطابقت دارد. اگر مقادیر همبستگی مثبت و منفی به طور متوسط باشد ، میانگین همبستگی پیرسون ممکن است نمایانگر خوبی از بزرگی همبستگی نباشد. بنابراین ، یک تجزیه و تحلیل آزمایشی دیگر با استفاده از مقدار همبستگی مطلق که نشان می دهد میانگین همبستگی در هر بار طول مدت انجام شده است. برای کل 49. 6 روز داده ، ما تمام نتایج زیر مجموعه ممکن را اندازه گیری کردیم ، و سپس روزهای پیوسته داده ها را می پوشیدیم. هر زیر مجموعه ای با همان طول مدت زمان و تاریخ شروع متفاوت ، نتایج خود را به طور متوسط داشته است.
این یک سری زمانی از مقادیر همبستگی برای هر یک از سلول ها در ماتریس همبستگی ما ایجاد کرد.< Pan> این یک سری زمانی از مقادیر همبستگی برای هر یک از سلول ها در ماتریس همبستگی ما ایجاد کرد. این یک سری زمانی از مقادیر همبستگی برای هر یک از سلولها در ماتریس همبستگی ما تولید می کند.
ما سری زمان همبستگی را برای همه استراتژی های پیش پردازش که دارای همان نوع نمره جمع آوری یکسان در همان شکل هستند ، برای نمایش این داده ها ترسیم کردیم. شکل 8 روند همبستگی متوسط احساسات منفی وادر با قیمت بیت کوین را برای زمان های مختلف داده نشان می دهد. بیشتر استراتژی های پیش پردازش در هنگام استفاده از کمتر از 20 روز از داده ها بهتر از متن خام عمل می کنند و ASCP منفی را نشان می دهند. استراتژی های برتر شامل تمیز کردن و تقسیم جملات با استفاده از کتابخانه NLTK به هر ترتیب قبل از حذف کلمات توقف آنها است. یک الگوی کلی ترکیب تمیز کردن متن و تقسیم جمله به هر ترتیب ، همبستگی بالاتری نسبت به حذف توقف کلمات از آن ترکیبات داشت. تقسیم جملات بدون ترکیب با سایر کارکردها بدتر از دو ترکیب اخیر است. با این حال ، این روند هنگام استفاده از بیش از 20 روز از داده ها ، به عنوان یک ASCP مثبت ، معکوس شد. تقسیم جملات به خودی خود بهتر از حذف کلمات توقف از هر ترتیب تقسیم جمله تمیز شده ، که بهتر از هر ترتیب تقسیم جمله تمیز شده بود. چند استراتژی پیش پردازش به طور مداوم بهتر از متن خام انجام می شود ، مانند تقسیم جملات با استفاده از regex هنگام استفاده از 35 تا 45 روز داده. بنابراین ، همبستگی متوسط احساسات منفی Vader در هر دقیقه روند متضادی را برای مجموعه داده های دارای طول زمان مختلف نشان می دهد. با استفاده از روزهای بیشتر داده ها ، اثربخشی استفاده از هر استراتژی پیش پردازش بر روی متن خام کاهش می یابد. به نظر می رسید تمیز کردن و تقسیم متن به هر ترتیب در 20 روز داده یا کمتر به نظر می رسد ، ضمن تقسیم متن خام به جملات با استفاده از Regexes بهترین کار در مجموعه داده های گسترده تر است. مهمترین افت در ASCP از 10. 05 - در هنگام همبستگی 8 تا 15 روز داده رخ داده است. بزرگترین قله ASCP 0. 123 در هنگام همبستگی حدود 40 تا 49. 6 روز داده رخ داده است. شکل 9 همبستگی متوسط احساس وادر خنثی با قیمت بیت کوین را نسبت به زمان های مختلف داده ها نشان می دهد. تنها استراتژی های پیش پردازش که به طور مداوم بهتر از استفاده از متن خام عمل می کردند ، تمیز کردن متن ، تقسیم متن به جملات با کتابخانه NLTK و تقسیم جملات با استفاده از NLTK پس از تمیز کردن متن بود. به طور کلی ، ترکیب جملات تقسیم شده NLTK با تمیز کردن به هر ترتیب ASCM خود را کاهش می دهد و از بین بردن توقف کلمات از آنها باعث کاهش بیشتر آن می شود. به طور مشابه ، از بین بردن کلمات توقف از متن تمیز ، ASCM آن را کاهش می دهد.
بهترین استراتژی های پیش پردازش پیش پردازش برای میانگین نمره خنثی Vader در هر دقیقه شامل تقسیم regex یا حذف کلمات توقف نمی شود. بالاترین قله در ASCP و ASCM برای همه استراتژی ها هنگام استفاده از حدود 6 تا 13 روز از داده ها رخ داده است ، به استثنای افزایش برای یک روز داده. این محدوده همبستگی مثبت در حدود 0. 135 را نشان داد. شکل 10 همبستگی بین میانگین احساسات مثبت Vader با قیمت بیت کوین را نشان می دهد. تمیز کردن متن هنگام استفاده از 1 یا 2 روز از داده ها بهتر است. تقسیم جملات با استفاده از regex هنگام استفاده از بیش از 20 روز داده بهتر عمل می کند. یک الگوی کلی ترکیب عملکردهای تقسیم متن با تمیز کردن ، ASCM آنها را کاهش می دهد و از بین بردن کلمات متوقف باعث کاهش بیشتر آنها می شود. این نشان می دهد که بهترین استراتژی های پیش پردازش عملکرد برای میانگین احساسات مثبت Vader در هر دقیقه متن خام است و به دنبال آن توابع منفرد (تمیز کردن یا تقسیم جمله به تنهایی). بزرگترین قله های منفی در ASCP ، از 0. 12 - و 0. 0. 10 - به ترتیب در هنگام استفاده از حدود 5 تا 8 و 31 تا 38 روز داده رخ داده است.
شکل 11 نمودارهای همبستگی میانگین احساساتی Vader ترکیب را در زمان های مختلف برای قیمت های بیت کوین نشان می دهد. هیچ استراتژی پیش پردازش ASCM به طور مداوم بالاتر از متن خام نیست. با این حال ، چند استراتژی پیش پردازش برای چند طول زیر مجموعه داده عملکرد خوبی دارند. متن تمیز ، جملات تقسیم شده با استفاده از کتابخانه NLTK و جملات تقسیم شده با استفاده از یک regex بهتر از استفاده از متن خام در هنگام 1 ، 19 یا بیشتر و 34 یا بیشتر روز داده با هم ارتباط داشتند. در شکل 11 ، به طور کلی ، بهترین استراتژی های پیش پردازش از کمترین میزان توابع ترکیبی استفاده می کردند. ترکیبی از توابع که جملات را با استفاده از کتابخانه NLTK تقسیم می کنند ، بهتر از آنهایی که از Regex استفاده می کنند ، عملکرد بهتری داشتند. بنابراین ، استراتژی های پیش پردازش برای میانگین نمره Vader مرکب در هر دقیقه با استفاده از متن خام به مدت کمتر از 19 روز داده و جملات تقسیم با استفاده از کتابخانه NLTK برای طول داده های بیشتر ، بهترین راهکارها را در بین سایر استراتژی ها انجام می دهد. بیشترین قله منفی در ASCP به ترتیب 06/0 ، 0. 08 - ، و 10/0 - در هنگام همبستگی 1 ، 5 تا 7 و 34 تا 44 روز داده بود.
شکل 12 نمودارهای همبستگی توییتهای منفی در دقیقه با قیمت بیت کوین را نشان می دهد. متن تمیز شده و متن تمیز شده با کلمات توقف که از نزدیک با همبستگی متن خام مطابقت دارند. متن تمیز شده بهتر از متن خام هنگام استفاده بین 35 روز تا 47 روز داده ، همزمان با بزرگترین قله ASCP است. یک الگوی کلی تقسیم جمله همراه با تمیز کردن متن ، با حذف کلمات کلیدی ، بهتر از هر روش تقسیم جمله ای انجام می شود ، که بهتر از هر ترتیب ترکیب تقسیم جمله و متن تمیز عمل می کند. بین سه استراتژی برتر ، شکاف زیادی در عملکرد وجود دارد: متن خام ، متن تمیز ، متن تمیز شده بدون توقف و دیگر استراتژی های پیش پردازش. بنابراین ، ASCM از حجم توییت های منفی در هر دقیقه بالاترین استفاده از این سه استراتژی بود. بالاترین قله ASCP در 40 روز از داده ها 0. 07 بود. اوج دیگری از حدود 0. 055 هنگام استفاده از 4 تا 6 روز داده رخ داده است.< pan> شکل 12 نمودارهای همبستگی توییتهای منفی در دقیقه با قیمت بیت کوین را نشان می دهد. متن تمیز شده و متن تمیز شده با کلمات توقف که از نزدیک با همبستگی متن خام مطابقت دارند. متن تمیز شده بهتر از متن خام هنگام استفاده بین 35 روز تا 47 روز داده ، همزمان با بزرگترین قله ASCP است. یک الگوی کلی تقسیم جمله همراه با تمیز کردن متن ، با حذف کلمات کلیدی ، بهتر از هر روش تقسیم جمله ای انجام می شود ، که بهتر از هر ترتیب ترکیب تقسیم جمله و متن تمیز عمل می کند. بین سه استراتژی برتر ، شکاف زیادی در عملکرد وجود دارد: متن خام ، متن تمیز ، متن تمیز شده بدون توقف و دیگر استراتژی های پیش پردازش. بنابراین ، ASCM از حجم توییت های منفی در هر دقیقه بالاترین استفاده از این سه استراتژی بود. بالاترین قله ASCP در 40 روز از داده ها 0. 07 بود. اوج دیگری از حدود 0. 055 در هنگام استفاده از 4 تا 6 روز از داده ها رخ داده است. شکل 12 نمودارهای همبستگی توییتهای منفی در دقیقه را با قیمت بیت کوین نشان می دهد. متن تمیز شده و متن تمیز شده با کلمات توقف که از نزدیک با همبستگی متن خام مطابقت دارند. متن تمیز شده بهتر از متن خام هنگام استفاده بین 35 روز تا 47 روز داده ، همزمان با بزرگترین قله ASCP است. یک الگوی کلی تقسیم جمله همراه با تمیز کردن متن ، با حذف کلمات کلیدی ، بهتر از هر روش تقسیم جمله ای انجام می شود ، که بهتر از هر ترتیب ترکیب تقسیم جمله و متن تمیز عمل می کند. بین سه استراتژی برتر ، شکاف زیادی در عملکرد وجود دارد: متن خام ، متن تمیز ، متن تمیز شده بدون توقف و دیگر استراتژی های پیش پردازش. بنابراین ، ASCM از حجم توییت های منفی در هر دقیقه بالاترین استفاده از این سه استراتژی بود. بالاترین قله ASCP در 40 روز از داده ها 0. 07 بود. اوج دیگری از حدود 0. 055 هنگام استفاده از 4 تا 6 روز داده رخ داده است.
شکل 13 نمودارهای همبستگی توییتهای خنثی در هر دقیقه را برای قیمت بیت کوین در زمان های مختلف نشان می دهد. استراتژی های برتر پیش پردازش ، جملات را با استفاده از کتابخانه NLTK یا Regex تقسیم می کنند. به طور کلی ، استراتژی هایی که از regex برای تقسیم جملات استفاده نمی کنند ، تمایل دارند که همبستگی متن خام را از نزدیک دنبال کنند. استراتژی های پیش پردازش که از توابع کمتری استفاده می کنند ، ASCM بالاتری را نسبت به غیر از این به دست می آورند. بنابراین ، استراتژی پیش پردازش که باعث می شود حجم توییت های خنثی در هر دقیقه ، که بهترین ها را با قیمت بیت کوین همبستگی می کند ، کتابخانه NLTK برای تقسیم جملات است. بالاترین قله ASCP هنگام استفاده از 6 تا 13 روز داده 0. 095 بود. شکل 14 همبستگی توییت های مثبت در دقیقه با قیمت بیت کوین را نشان می دهد. استراتژی های پیش پردازش که به طور مداوم بهتر از استفاده از متن خام عمل می کردند ، توابع تقسیم جمله همراه با یک یا چند کارکرد ، مانند تمیز کردن متن و/یا حذف توقف های توقف بودند. دو استراتژی برتر که بهترین کار را انجام داده اند شامل تمیز کردن متن قبل از استفاده از regex برای تقسیم جمله است. به طور کلی ، استراتژی های پیش پردازش که شامل ترکیب کارکردهای بیشتر است عملکرد بهتری دارند. بنابراین ، بهترین استراتژی پیش پردازش برای همبستگی قیمت بیت کوین با حجم توییت های مثبت در دقیقه شامل تمیز کردن متن قبل از تقسیم جمله توسط یک عملکرد regex است. بالاترین قله ASCP هنگام استفاده از 12 تا 20 روز داده در حدود 0. 085 بود. شکل 15 همبستگی کل در هر دقیقه توییت برای قیمت بیت کوین را نشان می دهد. هیچ استراتژی پیش پردازش نمی تواند بر کل توییت های دریافت شده از توییتر در هر دقیقه تأثیر بگذارد. از این رو ، هر عملکرد پیش پردازش دارای نمودارهای ASCM و ASCP است ، مانند شکل 15. بالاترین قله ASCP 0. 09 بود و هنگام همبستگی 6 تا 20 روز از داده ها رخ داده است.
شایان ذکر است که نمودارهای همبستگی کل توییت ها روند مشابهی دارند به عنوان نمودارهای همبستگی حجم خنثی و مثبت توییت. این ممکن است نشان دهد که همبستگی حجم کل توییت ها با حجم توییت های خنثی و مثبت نسبت به توییت های منفی هنگام استفاده از مجموعه داده های بلند مدت در مقیاس روز مشترک است. روند کلی نمودارهای فوق قوی ترین میزان همبستگی را برای مجموعه داده های کوتاه تر از داده های توییت کامل و قیمت های بیت کوین نشان می دهد. هنگام استفاده از یک روز از داده ها برای همبستگی ، تمام ASCM ها به طور قابل توجهی بالاتر از هنگام استفاده از تمام زمان های دیگر داده ها هستند (به جز میانگین نمرات منفی Vader در هر دقیقه). این می تواند نشانه احساسات بیان شده در توییتر باشد ، یا به تغییر قیمت بیت کوین پاسخ دهد یا پیش بینی کند. با این حال ، ASCP ها ، هنگام استفاده از یک روز از داده ها ، به طور قابل توجهی پایین تر از ASCM های مربوطه هستند. این ممکن است نشان دهد که هرگونه همبستگی مشاهده شده با احساسات بسته به تاریخ متفاوت است. ما حدس می زنیم که سنبله قابل توجهی در میزان همبستگی برای یک روز از داده ها در هر نمودار نشان می دهد که همبستگی ممکن است در هنگام مشاهده در یک بازه زمانی کوتاه تر ، مانند چند دقیقه به جای روز ، حتی قوی تر شود. در حالی که هیچ استراتژی پیش پردازش واحد وجود ندارد که عملکرد بهتری نسبت به بقیه برای انواع ویژگی ها داشته باشد ، می توانیم ببینیم که جملات تمیز کردن متن (و/یا) در اکثر بهترین استراتژی های هر ویژگی ارائه می شود. به نظر می رسید هر جمله ای که به خودی خود تقسیم می شود ، برای میانگین احساسات مثبت/خنثی و حجم صدای جیر جیر خنثی به بهترین وجه کار می کند ، در حالی که تقسیم NLTK همراه با تمیز کردن بهترین کار برای احساسات خنثی متوسط است. هرگونه تقسیم جمله همچنین برای حجم صدای جیر جیر خنثی بهتر کار می کرد ، در حالی که تمیز کردن متن برای حجم توییت منفی بهتر کار می کرد ، و پس از تمیز کردن متن ، برای حجم مثبت صدای جیر جیر بهترین کار را انجام می داد. انواع ویژگی ها با بالاترین ASCM ها در بالاترین قله آنها حجم مثبت/کل صدای جیر جیر بود که یک روز از داده پردازش شد. هیچ ویژگی "بهترین" مشخصی را نمی توان مشاهده کرد که تمام طول زیر مجموعه های داده در نظر گرفته شد. بالاترین ASCM ها همه احساسات متوسط Vader بودند که کمتر از 20 روز داده در هر زیر مجموعه بود. ASCP ها هنگام پردازش 35 یا بیشتر روز از داده ها ، اوج دوم را نشان می دهند تا میانگین احساسات منفی/مثبت/ترکیبی Vader و حجم توییت منفی را محاسبه کنند. این قله ها ممکن است نشانگر روند داده های طولانی مدت باشد که در خارج از 49 ما ادامه می یابد.
6 روز داده ، اما آنها به طور معمول کم هستند. با این حال ، آنها ممکن است در الگوریتم های یادگیری ماشین که وضعیت گذشته را به عنوان شبکه های عصبی مکرر حساب می کنند ، مفید باشند.
5. بحث < pan> 6 روز داده ، اما آنها به طور معمول کم هستند. با این حال ، آنها ممکن است در الگوریتم های یادگیری ماشین که وضعیت گذشته را به عنوان شبکه های عصبی مکرر حساب می کنند ، مفید باشند.
5. بحث 6 روز از داده ها ، اما آنها به طور معمول کم هستند. با این حال ، آنها ممکن است در الگوریتم های یادگیری ماشین که وضعیت گذشته را به عنوان شبکه های عصبی مکرر حساب می کنند ، مفید باشند.
5. بحث
فارکس را از کجا شروع کنیم...
ما را در سایت فارکس را از کجا شروع کنیم دنبال می کنید
برچسب :
نویسنده : علیرضا خمسه
بازدید : <-PostHit->
تاريخ : شنبه
27 اسفند
1401 ساعت: 22:27