sklearn. feature_extraction. text . countVectorizer¶

ساخت وبلاگ

کلاس sklea. feature_extraction. text. countVectorizer ( * ، input = 'محتوا "، رمزگذاری =' utf-8 '، decode_error =' strict '، strip_accents = هیچ ، حروف کوچک = درست ، preprocessor = هیچ ، none ، none ، stop_words = none ، token_patte =' (؟) \ b \ w \ w+\ b '، ngram_range = (1 ، 1) ، Analyzer =' Word '، max_df = 1. 0 ، min_df = 1 ، max_features = هیچ ، واژگان = هیچ ، باینری = کاذب ، dtype=) [منبع]

مجموعه ای از اسناد متنی را به ماتریس شمارش نشانه تبدیل کنید.

این پیاده سازی با استفاده از Scipy. Sparse. csr_matrix نمایشی پراکنده از شمارش را ایجاد می کند.

اگر یک فرهنگ لغت A-Priori ارائه ندهید و از آنالایزر استفاده نمی کنید که نوعی انتخاب ویژگی را انجام دهد ، تعداد ویژگی ها با اندازه واژگان موجود با تجزیه و تحلیل داده ها برابر خواهد بود.

در راهنمای کاربر بیشتر بخوانید.

  • اگر "نام پرونده" باشد ، انتظار می رود که توالی به عنوان استدلال برای متناسب بودن ، لیستی از نام های پرونده ای باشد که نیاز به خواندن برای واکشی محتوای خام برای تجزیه و تحلیل دارند.
  • اگر پرونده "پرونده" باشد ، موارد دنباله باید یک روش "خوانده شده" (شیء مانند پرونده) داشته باشند که برای واکشی بایت در حافظه فراخوانی می شود.
  • اگر "محتوا" باشد ، انتظار می رود ورودی دنباله ای از مواردی باشد که می توانند از نوع رشته یا بایت باشند.

اگر بایت یا پرونده هایی برای تجزیه و تحلیل داده شود ، از این رمزگذاری برای رمزگشایی استفاده می شود.

decode_error ، پیش فرض = "سخت"

در صورت ارائه دنباله بایت برای تجزیه و تحلیل که شامل کاراکترهایی است که از رمزگذاری داده شده استفاده نمی شود ، چه کاری باید انجام شود. به طور پیش فرض ، "سختگیرانه" است ، به این معنی که یک uniCodedEderror مطرح می شود. ارزش های دیگر "نادیده گرفتن" و "جایگزین" هستند.

Strip_accents یا قابل تماس ، پیش فرض = هیچ

لهجه ها را برداشته و در طول مرحله پیش پردازش ، عادی سازی شخصیت دیگر را انجام دهید."ASCII" روشی سریع است که فقط روی شخصیت هایی که نقشه برداری مستقیم ASCII دارند کار می کند."یونیکد" روشی کمی کندتر است که روی هر کاراکتر کار می کند. هیچکدام (پیش فرض) هیچ کاری نمی کند.

هر دو "ASCII" و "یونیکد" از عادی سازی NFKD از unicodedata. normalize استفاده می کنند.

بول کوچک ، پیش فرض = درست است

قبل از نشانه گذاری ، تمام کاراکترها را به حروف کوچک تبدیل کنید.

پیش پردازنده قابل تماس ، پیش فرض = هیچ

مرحله پیش پردازش (Strip_accents و کوچک) را ضمن حفظ مراحل تولید توکن و N-Grams نادیده بگیرید. فقط در صورت عدم تماس آنالایزر اعمال می شود.

Tokenizer قابل تماس ، پیش فرض = هیچ

ضمن حفظ مراحل تولید پیش پردازش و N-Grams ، مرحله توکن سازی رشته را نادیده بگیرید. فقط در صورت استفاده از آنالایزر == "کلمه" اعمال می شود.

stop_words ، لیست ، پیش فرض = هیچ

اگر «انگلیسی» باشد، از فهرست کلمات توقف داخلی برای انگلیسی استفاده می شود. چندین مشکل شناخته شده در مورد "انگلیسی" وجود دارد و شما باید یک جایگزین را در نظر بگیرید (به استفاده از کلمات توقف مراجعه کنید).

اگر لیستی وجود داشته باشد، فرض می شود که آن لیست حاوی کلمات توقف است که همه آنها از توکن های به دست آمده حذف می شوند. فقط در صورتی اعمال می شود که تحلیلگر == 'word' .

اگر هیچ، از هیچ کلمه توقف استفاده نمی شود. max_df را می توان روی مقداری در محدوده [0. 7، 1. 0) تنظیم کرد تا به طور خودکار کلمات توقف را بر اساس فراوانی عبارات سند درون پیکره شناسایی و فیلتر کند.

token_patte str یا None، پیش فرض=r”(? u)x08ww+x08”

عبارت منظم که نشان دهنده چیزی است که یک "توکن" را تشکیل می دهد، فقط در صورتی استفاده می شود که تحلیلگر == 'کلمه' . Regexp پیش فرض نشانه هایی از 2 یا بیشتر حروف عددی را انتخاب می کند (نقاط نگارشی به طور کامل نادیده گرفته می شود و همیشه به عنوان جداکننده نشانه در نظر گرفته می شود).

اگر یک گروه ضبط در token_patte وجود داشته باشد، محتوای گروه ضبط شده، نه کل تطابق، به نشانه تبدیل می شود. حداکثر یک گروه گرفتن مجاز است.

تاپل ngram_range (min_n، max_n)، پیش فرض=(1، 1)

مرز پایین و بالایی محدوده n-مقدار برای کلمه های مختلف n-gram یا char n-gram استخراج می شود. همه مقادیر n طوری که min_n

تحلیلگر یا قابل فراخوانی، پیش فرض='word'

این که آیا این ویژگی باید از کلمه n-gram یا کاراکتر n-gram ساخته شود. گزینه «char_wb» کاراکترهای n-gram را فقط از متن در داخل مرزهای کلمه ایجاد می کند. n-گرم در لبه کلمات با فاصله پر شده است.

اگر فراخوانی ارسال شود، برای استخراج دنباله ویژگی ها از ورودی خام و پردازش نشده استفاده می شود.

در نسخه 0. 21 تغییر کرده است.

از نسخه 0. 21، اگر ورودی نام فایل یا فایل باشد، داده ها ابتدا از فایل خوانده می شوند و سپس به تحلیلگر قابل فراخوان داده شده ارسال می شوند.

max_df شناور در محدوده [0. 0, 1. 0] یا int، پیش فرض=1. 0

هنگام ساخت واژگان، اصطلاحاتی را نادیده بگیرید که بسامد سند به شدت بالاتر از آستانه داده شده است (کلمات توقف خاص بدنه). اگر float باشد، پارامتر نسبتی از اسناد، شمارش مطلق اعداد صحیح را نشان می دهد. اگر واژگان None نباشد، این پارامتر نادیده گرفته می شود.

min_df شناور در محدوده [0. 0، 1. 0] یا int، پیش فرض=1

هنگام ساخت واژگان، عباراتی را نادیده بگیرید که بسامد سند به شدت کمتر از آستانه داده شده است. به این مقدار در ادبیات، برش نیز گفته می شود. اگر float باشد، پارامتر نسبتی از اسناد، شمارش مطلق اعداد صحیح را نشان می دهد. اگر واژگان None نباشد، این پارامتر نادیده گرفته می شود.

max_features int، پیش فرض=هیچکدام

اگر نه هیچ، واژگانی بسازید که فقط max_features برتر را که بر اساس فراوانی عبارت در بدنه مرتب شده اند در نظر بگیرد.

اگر واژگان None نباشد، این پارامتر نادیده گرفته می شود.

واژگان نقشه برداری یا تکرارپذیر، پیش فرض=هیچکدام

یا یک نگاشت (به عنوان مثال، یک دستور) که در آن کلیدها عبارت هستند و مقادیر شاخص هایی در ماتریس ویژگی هستند، یا یک عبارت قابل تکرار. اگر داده نشود، یک واژگان از اسناد ورودی تعیین می شود. شاخص ها در نقشه برداری نباید تکرار شوند و نباید هیچ شکافی بین 0 و بزرگترین شاخص داشته باشند.

باینری bool، پیش فرض = نادرست

اگر True باشد، همه شمارش های غیر صفر روی 1 تنظیم می شوند. این برای مدل های احتمالی گسسته که رویدادهای باینری را به جای شمارش های عدد صحیح مدل سازی می کنند، مفید است.

dtype dtype، پیش فرض=np. int64

نوع ماتریس برگردانده شده توسط fit_transform() یا transform().

ویژگی ها: واژگان_ دیکت

نقشه برداری از اصطلاحات به شاخص های ویژگی.

ثابت_واژگان_ bool

درست است اگر واژگان ثابتی از نگاشت اصطلاح به شاخص ها توسط کاربر ارائه شود.

stop_words_ set

اصطلاحاتی که نادیده گرفته شدند زیرا آنها یا:

  • در بسیاری از اسناد رخ داده است (max_df)
  • در اسناد بسیار کمی رخ داده است (min_df)
  • با انتخاب ویژگی قطع شدند (max_features).

این فقط در صورتی در دسترس است که واژگانی داده نشده باشد.

مجموعه ای از اسناد متنی را به ماتریس شمارش نشانه تبدیل کنید.

مجموعه ای از اسناد خام را به ماتریسی از ویژگی های TF-IDF تبدیل کنید.

ویژگی stop_words_ می تواند بزرگ شود و اندازه مدل را هنگام ترشی افزایش دهد. این ویژگی فقط برای درون نگری ارائه شده است و می توان آن را با استفاده از delattr حذف کرد یا قبل از ترشی روی None تنظیم کرد.

>>> از جانب sklea. feature_extraction. text وارد كردن CountVetorizer >>> مجموعه نوشته ها = [ . "این اولین سند است.", . "این سند دومین سند است.", . و این سومی است., . "این اولین سند است؟", . ] >>> بردار = CountVetorizer() >>> X = بردار.تناسب_تغییر(مجموعه نوشته ها) >>> بردار.get_feature_names_out() آرایه(['و'، 'سند'، 'اول'، 'است'، 'یک'، 'دوم'، 'the'، 'سوم'، 'این']، .) >>> چاپ(X.toarray()) [[0 1 1 1 0 0 1 0 1] [0 2 0 1 0 1 1 0 1] [1 0 0 1 1 0 1 1 1] [0 1 1 1 0 0 1 0 1]] >>> بردار 2 = CountVetorizer(تحلیلگر='کلمه', ngram_range=(2, 2)) >>> X2 = بردار 2.تناسب_تغییر(مجموعه نوشته ها) >>> بردار 2.get_feature_names_out() آرایه(['و این'، 'سند است'، 'اول سند'، 'هست'، 'این است'، "سند دوم"، "اول"، "دوم"، "سوم"، "سوم"، 'این سند'، 'این است'، 'این']، .) >>>print(X2. toarray()) [[0 0 1 1 0 0 1 0 0 0 0 0 1 0] [0 1 0 1 0 1 0 1 0 0 1 0 0] [1 0 0 1 0 0 0 0 0 1 1 0 1 0] [0 0 1 0 1 0 1 0 0 0 0 0 0 1]] 

برای پردازش داده های ورودی یک تماس قابل تماس را برگردانید.

قبل از نشانه گذاری ، یک تابع را به پیش پردازش متن برگردانید.

تابعی را که یک رشته را به دنباله ای از نشانه ها تقسیم می کند ، برگردانید.

ورودی را به یک رشته از نمادهای یونیکد رمزگشایی کنید.

یک فرهنگ لغت واژگان از همه نشانه ها را در اسناد خام بیاموزید.

فرهنگ لغت واژگان را بیاموزید و ماتریس اسناد را برگردانید.

برای تحول نام ویژگی های خروجی را دریافت کنید.

پارامترهایی را برای این برآوردگر دریافت کنید.

لیست کلمات توقف مؤثر را بسازید یا واکشی کنید.

شرایط را برای هر سند با ورودی های Nonzero در X برگردانید.

پارامترهای این برآوردگر را تنظیم کنید.

اسناد را به ماتریس مستند تبدیل کنید.

برای پردازش داده های ورودی یک تماس قابل تماس را برگردانید.

قابل تماس با پیش پردازش ، نشانه گذاری و نسل N-Grams.

بازگشت: آنالایزر: قابل تماس

تابعی برای رسیدگی به پیش پردازش ، نشانه گذاری و تولید N-Grams.

قبل از نشانه گذاری ، یک تابع را به پیش پردازش متن برگردانید.

بازگشت: پیش پردازنده: قابل تماس

تابعی برای پردازش متن قبل از نشانه گذاری.

تابعی را که یک رشته را به دنباله ای از نشانه ها تقسیم می کند ، برگردانید.

بازگشت: Tokenizer: قابل تماس

تابعی برای تقسیم یک رشته به دنباله ای از نشانه ها.

ورودی را به یک رشته از نمادهای یونیکد رمزگشایی کنید.

استراتژی رمزگشایی بستگی به پارامترهای بردار دارد.

پارامترها: Doc Bytes یا STR

رشته برای رمزگشایی.

بازگشت: Doc: Str

رشته ای از نمادهای یونیکد.

یک فرهنگ لغت واژگان از همه نشانه ها را در اسناد خام بیاموزید.

پارامترها: raw_document قابل تکرار است

قابل تکرار که یا اشیاء STR ، UNICODE یا FILE را تولید می کند.

هیچ

این پارامتر نادیده گرفته می شود.

بازگشت: خود شیء

fit_transform (raw_document ، y = هیچ) [منبع]

فرهنگ لغت واژگان را بیاموزید و ماتریس اسناد را برگردانید.

این معادل متناسب با ترانسفورماتور است ، اما با کارآمدتر اجرا می شود.

پارامترها: raw_document قابل تکرار است

قابل تکرار که یا اشیاء STR ، UNICODE یا FILE را تولید می کند.

هیچ

این پارامتر نادیده گرفته می شود.

بازگشت: x آرایه شکل (n_samples ، n_features)

get_feature_names_out (input_features = هیچ) [منبع]

برای تحول نام ویژگی های خروجی را دریافت کنید.

پارامترها: input_features مانند str یا هیچ یک ، پیش فرض = هیچ

مورد استفاده قرار نمی گیرد ، در اینجا برای قوام API توسط کنوانسیون وجود دارد.

بازگشت: feather_names_out ndarray از اشیاء str

نام های ویژگی تبدیل شده.

پارامترهایی را برای این برآوردگر دریافت کنید.

پارامترها: بول عمیق ، پیش فرض = درست است

در صورت صحت ، پارامترهای این برآوردگر و حاوی زیربناهای حاوی برآوردگر را برمی گرداند.

بازگشت: پارامترها دیکته

نام پارامترها به مقادیر آنها نقشه برداری شده است.

لیست کلمات توقف مؤثر را بسازید یا واکشی کنید.

بازگشت: stop_words: لیست یا هیچ کدام

لیستی از کلمات متوقف.

شرایط را برای هر سند با ورودی های Nonzero در X برگردانید.

پارامترها: x از شکل (n_samples ، n_features)

بازگشت: X_INV لیست آرایه های شکل (n_samples ،)

لیست آرایه های اصطلاحات.

پارامترهای این برآوردگر را تنظیم کنید.

این روش بر روی برآوردگرهای ساده و همچنین روی اشیاء تو در تو کار می کند (مانند خط لوله). دومی پارامترهای فرم __ را دارد تا بتوانید هر مؤلفه یک شیء تو در تو را به روز کنید.

پارامترها: ** پارامترها

بازده: نمونه برآوردگر خود

اسناد را به ماتریس مستند تبدیل کنید.

شمارش توکن از اسناد متنی خام با استفاده از واژگان مجهز به تناسب یا نمونه ای که به سازنده ارائه شده است ، شمارش می کند.

پارامترها: raw_document قابل تکرار است

قابل تکرار که یا اشیاء STR ، UNICODE یا FILE را تولید می کند.

بازگشت: ماتریس پراکنده X از شکل (n_samples ، n_features)

فارکس پرشین...
ما را در سایت فارکس پرشین دنبال می کنید

برچسب : نویسنده : الیزابت امینی بازدید : <-PostHit-> تاريخ : شنبه 16 ارديبهشت 1402 ساعت: 15:44