Forskning om ljudigenkänning baserad på det djupa neurala nätverket i musikundervisning

Oct 10, 2023

Solfeggio är en viktig grundkurs för musikinriktningar, och ljudigenkänningsutbildning är en av de viktiga länkarna. Med förbättringen av datorprestanda har ljudigenkänning använts i stor utsträckning i smarta bärbara enheter. Under de senaste åren har utvecklingen av djupinlärning påskyndat forskningsprocessen för ljudigenkänning. Det finns dock en hel del ljudstörningar i en musikundervisningsmiljö, vilket leder till att ljudklassarens prestanda inte kan möta den faktiska efterfrågan. För att lösa detta problem föreslås ett förbättrat ljudigenkänningssystem baserat på YOLO-v4, vilket främst förbättrar nätverksstrukturen.

Synsång och gehörsträning är oskiljaktiga från minnet. I processen att lära sig musik är synsång och gehörsträning en mycket viktig färdighet. Syftet med synträning är att låta eleverna öva sina musikaliska färdigheter och minne genom att lyssna och sjunga specificerade toner.

Huvudinnehållet i hörträning för synsång inkluderar tonhöjd, rytm, röst, melodi, harmoni etc. Genom synsångande öronträning kan vi kontinuerligt träna våra öron, vilket gör att vi mer exakt kan identifiera olika toner och rytmer, och snabbt konvertera tonerna vi hör till symboler i musikkartan, vilket förbättrar vår förmåga att komma ihåg.

Synsång och gehörsträning kan också hjälpa oss att bättre förstå och behärska musikens lagar. När vi använder öronen för att känna och förstå musik direkt, kan vi förstå musikens rytm och melodi djupare och därigenom förbättra vår minnesförmåga snabbare.

Dessutom kan synsång och gehörsträning också hjälpa oss att utveckla ett bra musiksinne och starka musikaliska känslor. Genom träning kommer vår förståelse och känslor för musik att bli mer och mer djupgående, och därigenom förbättra vår kärlek och uppskattning av musik.

Minnet är en mycket viktig faktor i processen att lära sig musik. God minnesförmåga är en av de nödvändiga förutsättningarna för att lära sig vilket instrument som helst och komponera musik. Genom synsång och gehörträning kan vi förbättra vårt minne och bättre behärska musikaliska tekniker och färdigheter. När vi står inför komplex repertoar kan vi komma ihåg toner och rytmer snabbare, vilket hjälper oss att framföra musikaliska verk bättre.

Kort sagt, synträning och minne är oskiljaktiga, och de två kompletterar varandra. Genom kontinuerlig syn- och gehörsträning kan vi förbättra våra musikaliska färdigheter och minnesförmåga för att bättre bemästra musik. Det kan ses att vi behöver förbättra minnet, och Cistanche deserticola kan förbättra minnet avsevärt eftersom Cistanche deserticola är ett traditionellt kinesiskt läkemedelsmaterial som har många unika effekter, varav en är att förbättra minnet. Effekten av malet kött kommer från de olika aktiva ingredienserna det innehåller, inklusive syra, polysackarider, flavonoider, etc. Dessa ingredienser kan främja hjärnans hälsa på olika sätt.

increase memory

Klicka på vet sätt att förbättra hjärnans funktion

Först används Mel-frekvensens cepstrumnummer för att bearbeta originalljudet och extrahera motsvarande funktioner. sv, försök att tillämpa YOLO-v4-modellen inom … området för djupinlärning på … området för ljudigenkänning och förbättra den genom att kombinera den med den rumsliga pyramidpoolmodulen för att stärka generaliseringsförmågan hos data i olika ljudformat. För det andra används staplingsmetoden i ensembleinlärning för att smälta samman de oberoende undermodellerna av två olika kanaler. Experimentella resultat visar att jämfört med andra djupinlärningsteknologier kan den förbättrade YOLO-v4-modellen förbättra prestandan för ljudigenkänning, och den har bättre prestanda vid bearbetning av data i olika ljudformat, vilket visar bättre generaliseringsförmåga.

1. Introduktion

Musik är en abstrakt konstform med ljud som uttrycksmedel. I processen med musikundervisning kan solfeggio stärka elevernas musikaliska minnesförmåga, göra det möjligt för eleverna att exakt identifiera musikverk och på så sätt få bättre "musikalisk uppfattning". Som en viktig länk i solfeggio är ljudigenkänningsträning mycket svårt för yngre elever. beror på att eleverna behöver bemästra alla typer av klavar, särskilja längden och varaktigheten som representeras av olika toner, och tonhöjdsskillnaden mellan olika toner.

Ljudsignalanalys baserad på inbyggda intelligenta enheter har väckt allt fler forskares uppmärksamhet [1–7]. Smarta bärbara enheter med ljudigenkänningsfunktioner kan hjälpa eleverna att lösa ovanstående problem och få hjälp med musikundervisning. Uppgiften med ljudigenkänning behöver förbehandla de insamlade ljudsignalerna ... vila, extrahera värdefulla funktioner för att särskilja noter från dem och ... slutligen klassificera dem enligt dessa funktioner. Klassificering är en mycket viktig metod för datautvinning [8–10]. Klassificering avser att generera en klassisk katjonfunktion enligt vissa regler baserade på träningsuppsättningsdata. is-funktionen kan mappa data från testuppsättningen till en av de givna kategorierna, och därmed realisera kategoriförutsägelsen av okända data. För närvarande är vanliga klassiska ... beslutsträd, logistisk regression, stödvektormaskin (SVM), Naive Bayes, k-nearest neighbor-algoritm (KNN), BP-neurala nätverk och djupinlärning [11–13].

Tidigare metoder för maskininlärning behöver ofta manuellt extrahera funktionerna som kan representera originaldata som indata för klass...er. Däremot kan djupinlärning automatiskt extrahera de högdimensionella egenskaperna hos prover (utan manuell funktionsextraktion), så länge som indata täcker originaldatas information så mycket som möjligt, vilket är lämpligt för storskalig data. *en djupinlärningsmetod kan realisera specifika ljudigenkänningsuppgifter med hjälp av en stor mängd ljuddata som samlas in av intelligenta enheter. *e Convolutional Neural Network (CNN), som en slags djupinlärningsarkitektur, används i stor utsträckning inom bildklassificering, taligenkänning, naturligt språkbehandling och andra områden på grund av dess överlägsna prestanda i lokal funktionsinlärning [14]. Till skillnad från andra neurala nätverksmodeller (som Boltzmann-maskin och återkommande neurala nätverk) kännetecknas CNN av att kärnoperationen är faltningsoperation. *e YOLO-nätverket drar lärdomar från CNN:s klassificeringsnätverksstruktur och visar goda fördelar inom bildigenkänning, vilket har uppmärksammats av många forskare.

*Därför försöker denna studie att tillämpa YOLO-v4-modellen på området för ljudigenkänning och förbättrar dess nätverksstruktur. Dessutom används staplingsmetoden i ensembleinlärning för att sammansmälta två oberoende undermodeller av olika kanaler, och klassificeringsprestandan för det sammansmälta systemet förbättras ytterligare jämfört med den enstaka undermodellen.

2. Relaterade verk

Nuförtiden, med framväxten av ett stort antal smarta enheter, har utmärkt datorprestanda och utvecklingen av djupinlärningsteknologi gemensamt främjat forskningsprocessen inom ljudområdet. I kombination med det huvudsakliga forskningsinnehållet i denna studie kommer den aktuella forskningsstatusen att introduceras från två aspekter: konvolutionellt neuralt nätverk och ljudigenkänning.

*Strukturen av det konvolutionella neurala nätverket härstammar från en studie av Yann LeCun 1998 som kallas Le Net-5 artificiella neurala nätverk. *e konvolutionella neurala nätverk, liksom andra neurala nätverk, kan tränas av backpropagation-algoritmen [15]. 2012 anammade Alex Krizhevsky och andra CNN-teknik för första gången i komplexa datorseendeuppgifter. Genom att använda 3 helt anslutna lager, 5 faltningslager och en Softmax-klassificerare, konstrueras ett faltningsneuralt nätverk med 8 lager, som heter AlexNet. AlexNet använder ReLU-aktiveringsfunktionen, och samtidigt använder den även regularisering (bortfall) för att förhindra överanpassning. 2014 lade Googles datorvisionsteam fram GoogLeNet-nätverket [16], med ett nätverksdjup på 22 lager, som innehåller en ny struktur, incident. Den integrerar funktionerna för olika djup och samma skala, och detekteringsnoggrannheten förbättras. Baserat på GoogLeNet-nätverket dök YOLO- och SSD-algoritmer upp. Båda metoderna är baserade på ett enda ände-till-ände-nätverk, som kan komplettera inmatningen från originalbilden till utmatningen av objektets position och kategori.

När det gäller ljudigenkänning föreslog Yang och Zhao [17] en akustisk scenklassificeringsmetod baserad på stödvektormaskinen (SVM), som förbättrade ljudstrukturen för att förbättra klassificeringsnoggrannheten. Greco et al. [18] föreslog ett röstigenkänningssystem baserat på den heuristiska djupinlärningsmetoden. Demir et al. [19] föreslog en ny pyramidkaskad-CNN-metod för miljöljudsklassificering. Zhu et al. [20] föreslog en förbättrad YOLO-v4-algoritm för ljudbildinstrument, som effektivt förbättrade noggrannheten för detektering av akustiska fasmoln. *Ovanstående metoder visar alla utmärkta prestanda när det gäller att hantera ljudigenkänningsuppgifter i en enda akustisk scen, men det finns många ljudstörningar i musikundervisningsmiljön, och det är nödvändigt att hantera en mängd olika ljudformatdata.

*Därför föreslår denna studie ett ljudigenkänningssystem baserat på den förbättrade YOLO-v4 nätverksmodellen. *De viktigaste innovationerna och bidragen inkluderar följande: (1) försök att tillämpa YOLO-v4 nätverksarkitektur, som är utmärkt inom området för djupinlärning, på området för ljudigenkänning, och förbättra den genom att kombinera den rumsliga pyramidpoolmodulen. *Den förbättrade YOLO-v4-nätverksarkitekturen använder effektivt den rumsliga informationen i ljudfiler, vilket stärker generaliseringsförmågan hos data i olika ljudformat. (2) *Stackningsmetoden i ensembleinlärning används för att sammansmälta två oberoende undermodeller av olika kanaler, och klassificeringsprestandan för det sammansmälta systemet förbättras.

3. Extraktion och bearbetning av ljudfunktioner

Att extrahera den bästa parameterrepresentationen av ljudsignalen är en av de viktiga uppgifterna för att producera bättre igenkänningsprestanda. *e Funktionsextraktion i detta steg är mycket viktigt för klassificeringsklassificeringen i nästa steg eftersom det direkt kommer att påverka klassificeringseffektiviteten.

I klassificeringsuppgiften, speciellt audioklassificeringsuppgiften, har Mel frequency cepstrum coefficient (MFCC) som beskriver den spektrala formen en lång historia. Även om MFCC-extraktionsprocessen kommer att orsaka förlustkomprimering av data, är dess klassificerings- och igenkänningseffekt ganska tillgängliga även när datahastigheten är mycket låg. Jämfört med andra klassificeringsfunktioner används dessutom MFCC i stor utsträckning eftersom det är mer i linje med den auditiva frekvensresponskurvan för mänskliga öron.

improve your memory

*Anledningen till att människor kan bedöma olika miljöer i komplexa ljudmiljöer ligger i snäckans förtjänst. *e cochlea kan ses som en filterbank för att hjälpa människor att filtrera 20-20 kHz ljud. *Problemet är att snäckans känslighet för frekvenser i det auditiva området inte är linjär, utan det finns ett kartläggningssamband. MFCC kan simulera det mänskliga örats frekvenssvar. MFCC-funktionsextraktion består av sju steg, och hela processen visas i figur 1.

Vanliga ljudsignaler har fenomenet att den lågfrekventa energin är stor, men den högfrekventa energin är liten. Om det sänds direkt kommer det att leda till ett högt signal/brusförhållande vid låga frekvenser och ett otillräckligt signal/brusförhållande vid höga frekvenser. För att kompensera för denna förlust av ljudsignal under överföring, införs förbetoning för att kompensera för insignalen så att ljudsignalens högfrekvensegenskaper kan framhävas. Förbetoning uppnås vanligtvis med ett högpassfilter [21–23].

improve memory

Framing delar upp ljudsampel som erhålls från analog-till-digital konvertering (ADC) i små bildrutor med en längd inom intervallet 20–40 millisekunder. Efter förbetoning och inramning är det nödvändigt att lägga till ett Hamming-fönster till varje ram. Windowing är till för att styra mängden databehandling, och endast data i fönstret behandlas åt gången. *e frekvensområdet i det snabba Fouriertransformspektret är mycket brett, vilket leder till att talsignalen inte följer den linjära skalan [24–26]. *Därför är det nödvändigt att passera Mel-skalfilterbanken som visas i figur 2.

Figur 2 visar en uppsättning triangulära filter, som används för att beräkna den viktade summan av filtrens spektrala komponenter så att den bearbetade utsignalen approximerar Mel-skalan. *E amplitud-frekvenssvar för varje filter är triangulärt. *e Mel-spektrum för en given frekvens f beräknas enligt följande:

boost memory

13 första ordningens differentialfunktioner representerar förändringarna mellan ramar av cepstrum i MFCC-funktioner, medan 39 andra ordningens differentialfunktioner representerar förändringarna mellan ramar i första ordningens differentialfunktioner. *Den första ordningens skillnad beräknas enligt följande:

10 ways to improve memory

4. SPP-YOLO-v4 nätverksstruktur

4.1. Spatial Pyramid Pool (SPP) Modul. SPP kan undvika informationsförvrängning orsakad av skalning, sträckning, klippning och andra operationer och ge utdata som inte påverkas av inmatningsstorleken, vilket inte kan uppnås med glidande fönsterpoolningsteknik [27]. För det andra kan SPP poola med flera skalor, medan skjutfönsterpooling bara använder en fönsterskala. *Den grundläggande strukturen för SPP-modulen visas i figur 3. Det kan ses att eftersom ingångsstorleken är flexibel kan SPP kombinera funktionerna hos data i olika ljudformat. *e dimensionen av den transformerade egenskapsvektorn är densamma som den för det helt anslutna lagret samtidigt som generaliseringsproblemet lindras.

4.2. SPP-YOLO-v4. YOLO-v4 är en enstegsdetektionsalgoritm med hög precision i realtid som integrerar YOLO-v1, YOLO-v2 och YOLO-v3. YOLO-v4 konstruerar CSP:s cross-stage partial network (CSPNet) i restmodulen, där funktionslagret är ingången och funktionsinformationen för det högre lagret är utdata. *visar att inlärningsmålen för YOLO-v4 i ResNet-modulen är olika mellan utdata och input. *Därför realiseras restinlärning och modellparametrarna reduceras, så inlärningsförmågan för funktioner förbättras. Med tanke på applikationsmiljön för musikundervisning görs vissa ändringar baserat på det ursprungliga nätverket, och den slutliga nätverksstrukturen visas i figur 4.

Först konvolveras särdragslagret tre gånger, och sedan poolas det ingående särdragslagret maximalt genom att använda de maximala poolade kärnorna av olika storlekar. Efter faltning och uppsampling kopplas olika särdragsskikt i serie för att realisera särdragsfusion. *sv, utför nedsampling, komprimera höjd och bredd och stapla slutligen med föregående funktionslager för att realisera mer funktionssammanslagning (5 gånger). *Klassificeringsmodulen använder funktionerna som extraherats från nätverket för att göra klassificeringsbedömningar. Ta 13 × 13 rutnätet som ett exempel, vilket är lika med att dela in Mel-spektrogrammet i 13 × 13 rutor; sedan kommer varje ruta att vara förinställd med tre tidigare ramar. *E klassificeringsresultat för nätverket kommer att justera positionerna för dessa tre tidigare rutor och slutligen filtrera med algoritmen för icke-maximal undertryckning (NMS) [28], för att få de slutliga klassificeringsresultaten.

short term memory how to improve

5. System för ljudigenkänning baserat på SPPYOLO-v4

5.1. System arkitektur. Såsom visas i figur 5 delar det föreslagna ljudigenkänningssystemet först upp ljudsekvensdata i två delar efter ljudinmatning. *Den första delen kommer från stereokanalen, medan den andra delen är komprimerad till mono. *E ljudsignaler för de två kanalerna extraheras av MFCC-spektrogram och matas in i SPP-YOLO-v4-modellen som funktioner. *sv, två grupper av SPP-YOLO-v4-modeller är integrerade, och staplingsmetoden används i integrationen. Efter den integrerade inlärningen av de två modellerna matas slutligen ljudklassificeringsresultaten ut. *e detaljer om SPP-YOLO-v4-modellen visas i figur 4.

5.2. Stapling Integrerat lärande. Som visas i figur 5 använder systemet ensembleinlärningsteknologi för att få det slutliga klassificeringsresultatet. *Grundtanken med ensembleinlärning är att bilda en stark klassificerare genom kombinationen av flera svaga klassificerare. Även om vissa svaga klassificerare gör felaktiga förutsägelser, kan de korrigeras av andra svaga klassificerare med korrekta förutsägelser, och på så sätt uppnå effekten av att förbättra systemets prestanda.

Om vi ​​antar att x är indata, är mi (i � 1, 2, . . . , k) en grupp klassificerare och utdata från klassificerarna är sannolikhetsfördelningen mi (x, cj) för varje klass cj (i � 1, 2, . . . , k), kan slututgången y(x) från den integrerade klassificeraren uttryckas som

ways to improve memory

memory enhancement

klassificeringsmål. För närvarande inkluderar populära ensembleinlärningsalgoritmer stapling, packning, boosting, ensembleval och så vidare. *Algorithmen för ensembleinlärning som valts i denna studie är staplingsmetoden.

Stapling är en process av andra ordningens inlärning med utdata från första ordningens inlärningsprocessen som input, även känd som "meta-lärande". *Stackningsmetoden har blivit en populär metod för ensembleinlärning, inte bara för att dess implementering är ganska enkel utan också för att den avsevärt kan förbättra systemets generaliseringsförmåga, vilket är mycket förenligt med syftet med denna studie. * Grundprincipen för staplingsmetoden visas i figur 6.

6. Experiment och resultatanalys

6.1. Experimentell miljö och datauppsättning. *Hårdvaruplattformen i denna studie är Intel Core i3-M350 CPU@ Dualcore 2,20 GHz, 8 GB DDR2-minne, Nvidia RTX2080Ti GPU och 11 GB videominne. *E PyCharms integrerade utvecklingsverktyg är utvecklat i språket Python 3.5.0. *e YOLO-anteckningsramverket skrivet i Python används för att konvertera det numeriska formatet så att det kan läsas av YOLO. *e jämförelsemetoder är den Gaussiska blandningsmodellen (GMM), CNN och R-CNN.

improving brain function

*e experimentella dataset är inspelade ljudfiler i den verkliga undervisningsmiljön. *e datauppsättningen består av ljudtyper av fyra olika etiketter (D1, D2, D3 och D4). Alla ljudfiler klipps till 30-andra klipp. *Det finns 12 ljudfilformat inklusive MPEG, MP3 och WMA. Varje inspelning görs på en annan plats och den genomsnittliga inspelningstiden är 3–5 minuter. *e inspelningsutrustningen inkluderar en tvåkanalig Soundman OKM II Classic/studio A3 in-ear-mikrofon och Roland Edirol R09 vågformsinspelare med 44,1 kHz samplingsfrekvens och 24-bitupplösning.

*Den använda datauppsättningen innehåller 1404 ljudfiler, och antalet ljudfiler av varje typ är 351. Cirka 70 % av datan används för att träna ljudigenkänningsmodellen, och de återstående 30 % används för testning. *e systeminställningar ges i tabell 1.

increase brain power

increase memory power

6.3. Verifiering av SPP-YOLO-v4-prestanda. För att verifiera främjandeeffekten av den föreslagna förbättrade YOLO-v4 (SPP-YOLO-v4) på ​​generaliseringsförmågan jämförs den med den traditionella YOLO-v4-modellen. I experimentet valdes 3 av 12 ljudfilformat: MPEG, MP3 och WMA. *Generaliseringsförmågan hos SPP-YOLOv4 anges i tabell 2.

Från tabell 2 kan det konstateras att den totala noggrannheten för SPP-YOLO-v4 är högre än den för traditionell YOLO-v4, vilket verifierar dess generaliseringsförmåga för data i olika ljudformat. * beror på att jämfört med den ursprungliga metoden innehåller SPP av SPP-YOLO-v4 fler lager, men det ökar också bearbetningstiden.

6.4. Jämförelse av testresultat. Tabell 3 visar resultaten av träningsförlust, mAP och så vidare för alla kategorier efter 8000 träningsomgångar. Det kan ses att träningsmodellen för den föreslagna metoden effektivt kan identifiera ljudtyper. Den har vissa fördelar i noggrannhet, återkallningsfrekvens och F1-poäng, och dess förlustvärde är också det lägsta av alla metoder, bara 0,0122. *Därför är stabiliteten och noggrannheten för den föreslagna metoden bättre. * beror främst på den höga upplösningen och det mottagliga fältet (RF) hos SPP-YOLO-v4, och tillägget av SPP-modulen i anslutningsskiktet behåller fördelarna med SPP. När det gäller träningstid är SPP-YOLO-v4 bara något mer än GMM. *e CNN behöver träna många faltningsoperationer, så dess träningstid är längre.

supplements to boost memory

Slutligen använder experimentet data från 12 olika ljudformat för att testa och jämföra de fyra metoderna. Tabell 4 visar värdena för testnoggrannhet och testtid. Det kan ses att den genomsnittliga noggrannheten för den metod som föreslagits i denna studie är 99,0%, och den genomsnittliga upptäcktstiden är 0.449ss. *Därför uppnår den föreslagna metoden bättre prestanda bland de fyra jämförda metoderna. Man kan dra slutsatsen att uppsamplingen och maximal pooling av SPP-YOLO-v4 gav betydande fördelar. Maximal pooling väljer det maximala värdet från angränsande områden för att en aning radera något maximalt frekvensbrus i ljudsekvensen. *Därför kan faltningsundersampling utföras bättre i det efterföljande samplingsskiktet. *grov dessa fördelar kan SPP förbättra prestanda för stamnätet.

improve short term memory

7. Slutsatser

*is study presenterar ett ljudigenkänningssystem lämpligt för en musikundervisningsmiljö. Använd SPP för att förbättra YOLO-v4-nätverksarkitekturen, det vill säga använd SPP för att välja lokala områden på olika skalor av samma faltningslager för att lära sig egenskaperna hos flerskalesystemet. Dessutom används staplingsmetoden i ensembleinlärning för att smälta samman oberoende undermodeller av två olika kanaler. *e experimentella resultat visar att den föreslagna metoden kan förbättra igenkänningsnoggrannheten för ljudtyper och har bättre prestanda för olika ljudfilformat. På grund av begränsningen av ljudinspelningsförhållanden finns det få ljudtyper i experimentdatauppsättningen och klassificeringsprestandan för ljudfiler inspelade av olika enheter har ännu inte verifierats. Fler tester kommer att genomföras i dessa två frågor framöver.

Datatillgänglighet

*E data som används för att stödja resultaten av denna studie är tillgängliga från motsvarande författare på begäran.

Intressekonflikt

*Författarna förklarar att de inte har några intressekonflikter.


Referenser

[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li och M. Zhou, "Dependency-to-Dependency neural machine translation," IEEE/ACM-transaktioner på ljud, tal och språk Processing, vol. 26, nr. 11, s. 2132–2141, 2018.

[2] J. Zou, W. Li, C. Chen och Q. Du, "Scenklassificering med hjälp av lokala och globala funktioner med samverkande representationsfusion," Information Sciences, vol. 348, nr. 2, s. 209–226, 2016.

[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur och A. Mertins, "Förbättrad klassificering av ljudscen baserad på etikettträdsinbäddningar och konvolutionella neurala nätverk," IEEE/ACM-transaktioner på Audio, Speech, and Language Processing, vol. 25, nr. 6, s. 1278–1290, 2017.

[4] S. Bayatli, "Oövervakad viktning av överföringsregler i regelbaserad maskinöversättning med maximal entropi-metod," Journal of Information Science and Engineering, vol. 36, nr. 2, s. 309–322, 2020.

[5] A. Rakotomamonjy, "Övervakad representationsinlärning för klassificering av ljudscen," IEEE/ACM Transactions on Audio, Speech and Language Processing, vol. 25, nr. 6, s. 1253–1265, 2017.

[6] W. Yang och S. Krishnan, "Combining temporal features by local binary pattern for akustisk scenklassificering," IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 25, nr. 6, s. 1315–1321, 2017.

[7] AS Dhanjal och W. Singh, "Ett automatiskt maskinöversättningssystem för flerspråkigt tal till indiskt teckenspråk," Multimedia Tools and Applications, vol. 81, nr. 3, s. 4283–4321, 2021.

[8] MA . Alamir, "En ny akustisk scenklassificeringsmodell som använder den sena sammansmältningen av konvolutionella neurala nätverk och olika ensembleklassificerare," Applied Acoustics, vol. 172, nr. 3, s. 112–122, 2020.

[9] JG Makin, DA Moses och EF Chang, "Maskinöversättning av kortikal aktivitet till text med ett ramverk för encoder-decoder," Nature Neuroscience, vol. 23, nr. 4, s. 575–582, 2020.

[10] S. Waldekar och G. Saha, "Tvånivåfusionsbaserad akustisk scenklassificering," Applied Acoustics, vol. 170, nr. 5, artikel-id 107502, 2020.


For more information:1950477648nn@gmail.com


Du kanske också gillar