لینک دانلود و خرید پایین توضیحات
دسته بندی : وورد
نوع فایل : word (..doc) ( قابل ویرایش و آماده پرینت )
تعداد صفحه : 8 صفحه
قسمتی از متن word (..doc) :
1
(خلاصه)
این مقاله به توصیف الگوریتم مسیر یابی Q برای مسیر یابی packet در ماجول تقویت کننده آموزش دهنده که در هر گروه از یک شبکه جابجا کننده قرار داده شده است می پردازیم. تنها ارتباطهای محلی برای هر گیرنده بکار می رود تا آمار آنها را در مرحله تصمیم های جهتیابی دقیق نگاه دارد که منجر به کاهش زمان ارسال می گردد. در آزمایشهای ساده که حاوی 36 گره است و شبکه بصورت بی قاعده ای متصل گردیده است. جهتیابی Q برتری حضور را نسبت به الگوریتم غیر قابل تطابق مبتنی بر محاسبات کوتاهترین مسیر ها به اثبات می رساند و قادر خواهد بود تا به میزان کافی جهتیابی انجام دهد حتی زمانی که ویژگیهای بسیار مهم شبیه سازی همانند load کردن شبکه اجازه می یابند تا بطور پویا تغییر پیدا کنند. این مقاله در برگیرنده بحثی در مورد حالت حد ووسط بین کشف میان برها و سیاستهای با ثبات نگه داشتن می باشد.
معرفی INTROSUCTION
حیطه تقویت دانش بنحو چشمگیری در طی چند سال اخیر رشد کردهاست البته به استثناء ماتریس [8,2] که کاربردهای موفقیت آمیزی کمتری در مقایسه با کارهای عملی و بزرگ دشته است. این مقابله نشان می دهد که کار عملی جهتیابی Pachat ها درون یک ارتباط شیبکه ای یک کاربرد طبیعی برای الگوریتم تقویت کننده دانش می باشد.
الگوریتم جهتیابی Q تا، متناسب با برخی الگوریتمهای جهتیابی packet توزیع شده [6,7] یاد می دهد که سیاست جهتیابی که در آن توزان ها تعداد پرشهای یک pachet را به حداقل می رسانند با احتمال انسداد مسیرهای شلوغ بدست خواهد آمد. این امر به کمک آزمایش روشهای جهتیابی گوناگونم و جمع آوری آمار درباره تصمیمهایی که زمان ارسال را به حداقل می رساند میسر خواهد شد. یادگیری مستمر و پیوسته خواهد بود، تنها از اطلاعات محلی استفاده می کند و بصورت بی قاعده بسیار قوی و یکپارچه عمل می کند و الگوهای ارتباط شبکه دائما در حال تغییر load شدن است.
2
آزمایشات در این مقاله به کمک شبیه ساز گسسته رویداد صورت گرفته است تا حول انتقال packet ها را در درون یک شبکه محلی بدست دهد و در بخش [5] توضیح کامل در این مورد داده شده است.
جهتیابی برای تقویت عملکرد یادگیری Routiny As A Reinforcement learniy task
سیاست جهتیابی یک packet پاسخگویی این پرسش می باشد که : به کدام گروه مجاور می بایستی گره فعلی packet های خود را ارسال کند در مقایسه با مقصد نهایی اش آزاد دریافت دارد؟ از آنجائیکه عملکرد این روش به کمک کل زمان بدست آمده جهت ارسال یک packet اندازه گیری می شود، هیچ سیگنال آموزش دهنده ای برای برآورد کردن مستیم یا بهبود دادن سیاست تا زمانیکه یک packet نهایتا به مقصد خود می رسد وجود ندارد. با اینهمه، با استفاده از تقویت یادگیری،روش می بایستی سریعتر بروز شود و تنها از اطلاعات محلی استفاده کرد. فرض کنید Q(x)(d,y) زمانی باشد که یک گروه x تخمین زده می شود که یک packet را به گره d به کمک گروه همسایه x یعنی y تحویل دهد، که در برگیرنده هر زمانی است که p می بایستی در صفx صرف کند. در زمان ارسال p به y، x فورا برآورده y را برای زمان باقیمانده جهت ارسال بر می گرداند در نتیجه:
اگر packet مقدار q واحد زمان در صف x صرف کند و s واحد زمانی در انتقال بین گروه های y,x در نتجه x می تواند برآورده خود را طبق رابطه زیر بازبینی کند:
جایئکه پارامتر نرخ یادگیری است (معمولا در آزمایشس ما Q.5 در نظر گرفته می شود.)
اگلوریتم منبع می تواند در حکم نسخه ای از الگوریتم کوتاهترین مسیر Bellman – Ford در نر گرفته شود که (1) نمایش دهنده گامهای مسیر آن بصورت غیر همزمان و online می باشد و
