набір даних | Наукові журнали та конференції

Метод виявлення дезінформації на основі аналізу текстових даних із застосуванням TF-IDF та контекстних векторних представлень

У статті розглянуто підхід до виявлення джерел дезінформації у цифровому середовищі за допомогою аналізу текстів із використанням методів машинного навчання та опрацювання природної мови. Запропонований метод базується на гібридному представленні тексту, яке поєднує частотні ознаки (TF-IDF) з контекстними векторними представленнями, отриманими за допомогою моделі IBM Granite.

Дослідження методів інтелектуального аналізу даних для класифікації незбалансованих наборів даних

Завдяки стрімкому розвитку інформаційних технологій, які широко використовуються у всіх сферах людського життя та діяльності, сьогодні накопичено надзвичайно великі обсяги даних. Відповідно застосування методів машинного навчання до цих даних дає змогу отримати нові практично корисні знання, які можуть бути використані для маркетингових, управлінських та дослідницьких цілей. Серед завдань інтелектуального аналізу даних – задачі регресії, прогнозування, кластеризації, класифікації та асоціативних правил. У цьому дослідженні розв’язано задачу бінарної класифікації.

Speech Models Training Technologies Comparison Using Word Error Rate

The main purpose of this work is to analyze and compare several technologies used for training speech models, including traditional approaches as Hidden Markov Models (HMMs) and more recent methods as Deep Neural Networks (DNNs). The technologies have been explained and compared using word error rate metric based on the input of 1000 words by a user with 15 decibel background noise. Word error rate metric has been ex- plained and calculated. Potential replacements for com- pared technologies have been provided, including: Atten- tion-based, Generative, Sparse and Quantum-inspired models.