2026 say 1 Azərbaycan di̇li̇ üçün mi̇lli̇ korpusun formalaşdirilmasinda Veb scrapi̇ng və veri̇lənlər bazasi texnologi̇yalarinin tətbi̇qi̇

DOI :   https://doi.org/10.30546/670832.2026.013.1048

Xülasə:  Məqalədə Azərbaycan dili üçün milli yazılı korpusun formalaşdırılması prosesində web scraping, Python əsaslı mətn emalı və Oracle verilənlər bazası texnologiyalarının tətbiqi təqdim olunur. Tədqiqatın əsas məqsədi qəzet, jurnal və rəsmi internet saytları kimi açıq veb mənbələrindən Azərbaycan dilində mətnlərin avtomatik toplanması, ilkin təmizlənməsi, strukturlaşdırılması və sonrakı analiz üçün verilənlər bazasında saxlanılmasıdır. İşin mühüm cəhəti ondan ibarətdir ki, korpusun yaradılması yalnız mətnlərin toplanması ilə məhdudlaşmır; xam HTML məzmunundan əsas məqalə mətninin ayrılması, kodlaşdırma uyğunsuzluqlarının aradan qaldırılması, dublikat materialların müəyyənləşdirilməsi, söz vahidlərinin çıxarılması və tezlik nəticələrinin SQL sorğuları vasitəsilə CSV formatına ixracı kimi mərhələlər vahid texnoloji ardıcıllıq şəklində qurulur. Hazırlanmış yanaşma təxminən yarım milyon söz həcmində ilkin korpus bazasının formalaşdırılmasına, söz tezliklərinin hesablanmasına və dilçi mütəxəssislər üçün istifadə oluna bilən analitik nəticələrin əldə edilməsinə imkan verir. Məqalə informasiya texnologiyaları baxımından milli dil resurslarının yaradılmasında proqramlaşdırma, verilənlər bazası və mətn emalı texnologiyalarının qarşılıqlı tətbiqini izah edir.

Açar sözlər: milli dil korpusu, Azərbaycan dili, web scraping, Python, Oracle, SQL sorğuları, CSV, mətn emalı, söz tezliyi.