Förbättrar testning nytt lärande eftersom det isolerar mot proaktiv störning?(2)
Jun 08, 2023
Experiment 3
Målet med Experiment 3 var att troget replikera Experiment 2 av Nunes och Weinstein (2012). För detta ändamål kontaktade vi den primära författaren av den studien och bekräftade att vårt material och vårt förfarande representerar en trogen, direkt replikering av deras studie (Nunes, personlig kommunikation, 2020). Det fanns fyra anmärkningsvärda skillnader mellan experiment 3 och experiment 1 och 2. Först studerade deltagarna DRM-ord istället för kategoriserade ord. För det andra studerade deltagarna 12 ord per lista istället för 16 ord per lista. För det tredje visades varje ord i 2 s och endast en gång (i våra experiment 1 och 2 studerade deltagarna varje ord två gånger med 4 s vardera). Slutligen löste deltagarna i kontrollvillkoret matematiska problem istället för att omstudera listan.

Öken ginseng
Metod
Design och deltagare
Mirroring Nunes och Weinstein (2012) använde Experiment 3 en enfaktors design på två nivåer (dvs. test kontra inget test), med denna faktor manipulerad mellan försökspersoner. Sammanlagt 71 studenter från Iowa State University deltog för kurskreditering. Data från fyra deltagare analyserades inte – två på grund av att de inte följde instruktionerna och två på grund av ett försöksfel. Det slutliga urvalet inkluderade alltså data från 67 deltagare, med 36 i testtillståndet och 31 i no-testtillståndet. Känslighetseffektanalys visade att denna provstorlek hade 0,80 effekt för att detektera en effektstorlek på d=0.70.

Cistanche deserticola
Material och tillvägagångssätt
Materialen och procedurerna var desamma som i Nunes och Weinstein (2012), Experiment 2). Fyra DRM-listor (berg, mjuk, flod och stad) från Stadler et al. (1999) normer användes som studiematerial. Listorna 1–4 innehöll 12 ord från ett enda DRM-tema. Ord i tredje, femte och 13:e positionerna för varje DRM-tema i Stadler-normerna presenterades endast i mållistan 5. Fyra olika motvikter användes, så att vissa deltagare studerade den mjuka listan som Lista 1 och andra studerade den som deras Lista 2, 3 eller 4. Ordens ordning inom varje lista var dock fixerad och presenterad i samma ordning som de förekom i Stadler et al. normer (dvs. kullen presenterades alltid först, dalen, sedan underkasta sig, etc.). Observera att utjämningsschemat endast påverkade orden i listorna 1–4; de ord som valts ut för Lista 5 var inte uppvägda, så att dessa ord aldrig förekom i listorna 1–4 för några deltagare. Lista 5 presenterade de tre tidigare icke-studerade orden från varje studerat DRM-tema i en annan slumpmässig ordning för varje deltagare, men alla deltagare studerade samma ord i Lista 5.
Alla ord presenterades i 2 s vardera med ett 500-ms interstimulusintervall. Efter varje lista löste deltagarna tio matteproblem på 6 s vardera. Sedan hade deltagarna i testvillkoret 60 s på sig att återkalla orden från den nyss studerade listan, medan de i testvillkoret inte löste ytterligare matematiska problem i ytterligare 60 s. Efter att ha studerat Lista 5 löste alla deltagare matematiska problem i 60 s och tog sedan ett återkallningstest. De genomförde sedan ett 5-min kumulativt återkallningstest. Det kumulativa testet utfördes som en del av replikeringen, men data från detta test var inte av intresse och fick därför inte poäng.

Cistanche deserticola experiment
Resultat
Intrång under återkallelse av lista 5
I experiment 1 och 2 använde vi frekvens för att rapportera intrångsdata, vilket är det dominerande måttet i litteraturen (Chan, Manley, et al., 2018; Weinstein et al., 2014). Men här rapporterar vi intrång med användning av såväl frekvens som proportioner eftersom de senare användes för att presentera intrång i Nunes och Weinstein (2012). Specifikt delade de frekvensen av intrång med 60, vilket var antalet studieord över alla fem listorna. I enlighet med Nunes och Weinstein räknade vi inte falskt återkallande av de kritiska DRM-orden som intrång. Istället poängsattes dessa ord separat som kritiska falska minnen.

Fig. 6 Frekvens av intrång under återkallande av lista 5 (vänster) och andel av korrekt återkallande av lista 5 (höger) som en funktion av mellanliggande uppgift och PI-nivå i experiment 3. Felstaplar visar beskrivande 0,95 konfidensintervall. Jitter introducerades för att sprida datapunkter horisontellt för att öka synligheten
Outlier cut-off för intrång var 4,03 objekt (M=0.97, SD=1.53), vilket exkluderade data från fyra deltagare. Den vänstra panelen i fig. 6 visar frekvensen av intrång under återkallande av lista 5. Intressant nog, till skillnad från resultaten i experiment 1 och 2, fanns det ingen signifikant skillnad i intrång mellan de testade deltagarna (M=0.50, M=.01 i proportioner) och de icke-testade deltagarna (M { {15}}.89, M=.02 i proportioner), t(61)=1.66, p=.102, d=0.42, B 01=1.22. Dessa data är jämförbara med resultaten av Nunes och Weinstein (2012), som inte fann någon signifikant effekt av ingripande aktivitet på intrång. Intressant nog, när vi undersökte intrångsdata med extremvärdena inkluderade, minskade interpolerad testning signifikant intrång (d=0.72, se OSM för detaljer), och replikerade därmed mönstret som rapporterades i experiment 1 och 2.
Efter Nunes och Weinstein (2012) rapporterades kritiska falska återkallelser som proportioner (med frekvensen av kritiska falska återkallelser dividerat med 4 eftersom det fanns fyra DRM-teman). I likhet med Nunes och Weinsteins resultat (Mtest=0.04, Mno-test=0.06), skilde sig inte återkallningsfrekvensen av kritiska ord signifikant mellan test- och no-testvillkoren (Mtest {{ 8}}.08, M no-test=0.15), t(61)=0.70, p=.489, d=0.18 B{ {20}}.14.
Lista 5 korrekta återkallelser
De viktigaste resultaten presenteras i den högra panelen i fig. 6. I likhet med våra experiment 1 och 2, men i motsats till Nunes och Weinstein (2012), observerade vi en robust framåttestningseffekt på lista 5 korrekt recall, t(61)=2.93, p=.005, d=0.75, B10=8.39 (Mtest=.44, Mno-test=.29). Detta fynd stämmer överens med vad vi rapporterade i experiment 1 och 2, men skilde sig från Nunes och Weinstein (2012), som inte hittade någon framåtriktad testeffekt (d ≈ 0, Mtest=.46, Mno-test {{26 }} .46). Dessutom, genom att replikera resultaten från våra experiment 1 och 2, observerades en negativ korrelation mellan intrång och korrekt återkallelse (se fig. 7), r(61)=-.35, p=.005, B 10=7.32. Till skillnad från experiment 1 och 2, bidrog korrelationen av deltagare i både testvillkoret, r(34)=-.34, p=.042, B01=1.51 och no-test condition, r(25)=-.27, p=.176, B01=1.75. Vi tror att den icke-signifikanta korrelationen i tillståndet utan test kan bero på otillräcklig kraft.
Diskussion
Resultaten i experiment 3 liknade till stor del de från våra experiment 1 och 2 – det vill säga interpolerade tester underlättade ny inlärning även när deltagarna studerade ord i en miljö som var tänkt att minimera uppbyggnaden av PI. Detta fynd står i direkt kontrast till det som rapporterats av Nunes och Weinstein (2012) och är särskilt spännande när det ses i sammanhanget med det övergripande replikeringsarbetet. Specifikt, även om vår studie använde ett annat deltagarurval och data samlades in nästan ett decennium senare än den ursprungliga studien, replikerade våra data på vissa sätt de från den ursprungliga studien exceptionellt bra. Faktum är att de flesta av de beroende variablerna, inklusive mängden studerade ordintrång (i proportioner, Mtest=.01, Mno-test=.02 i vårt experiment, Mtested=.01 , Mno-test=.04 i Nunes och Weinstein), falskt återkallande av kritiska ord (Mtest=.02, Mno-test=.04 i vårt experiment, Mtested {{19 }} .04, Mno-test=.06 i Nunes och Weinstein), och korrekt återkallelse av de studerade orden i testvillkoret (M=.44 i vårt experiment, M {{26} } .46 i Nunes och Weinstein), producerade data som var anmärkningsvärt lika de som rapporterats av Nunes och Weinstein. Det enda undantaget var korrekt återkallningsdata i tillståndet utan test. Medan våra deltagare kom ihåg .29 av listan 5-ord, kom Nunes och Weinsteins deltagare ihåg .46. På grund av den större provstorleken på vårt experiment och dess replikering av experiment 1 och 2, tror vi att vårt resultat förmodligen gav en närmare approximation av populationsmedelvärdet. Men med tanke på den teoretiska vikten av detta resultat, strävade vi efter att replikera experimentet igen i experiment 4 men med ett fullständigt motviktsschema.

Fig. 7 Ett spridningsdiagram som visar förhållandet mellan frekvensen av intrång under återkallande av lista 5 och andelen korrekt återkallande av lista 5 i experiment 3. För att förbättra synligheten för datatätheten introducerade vi jitter för att sprida datapunkterna horisontellt
Experiment 4
Metod
Design, deltagare, material och tillvägagångssätt
Sammanlagt 70 studenter från Iowa State University deltog för kurskreditering. Till skillnad från experiment 1–3, där data samlades in i vårt laboratorium, samlades data från experiment 4 in online på grund av den covid-19-relaterade avstängningen av personlig forskning. Data från tre deltagare (dvs en i testtillståndet och två i tillståndet utan test) analyserades inte eftersom de inte följde instruktionerna. Det slutliga urvalet inkluderade data från 67 deltagare, med 34 i testtillståndet och 33 i no-testtillståndet. Känslighetseffektanalys visade att denna provstorlek hade 0,80 effekt för att detektera en effektstorlek på d=0.69.
Materialen och procedurerna var identiska med de i experiment 3 med följande undantag. I experiment 3 innehöll lista 5 alltid samma ord. I det aktuella experimentet balanserade vi helt ordtilldelningar till alla fem listorna, så att orden som förekom i lista 5 för en deltagare skulle visas i lista 1, 2, 3 eller 4 för en annan deltagare. Vi delade upp varje uppsättning av 15 DRM-temaord i fem grupper, där varje grupp har liknande bakåtassociativ styrka (BAS), vilket anger styrkan av associationen från listpunkten till det kritiska ordet (Roediger et al., 2001). De fem grupperna av DRM-ord roterade över deltagarlistorna. Detta utjämningsschema eliminerade möjligheten att resultaten endast skulle gälla för de särskilda DRM-ord som valts för att visas i lista 5 i vårt experiment 3 och Nunes och Weinsteins experiment 2 (2012). För det andra presenterades orden i varje lista (och inte bara lista 5) i slumpmässig ordning. Vi valde detta förfarande eftersom vi ville undvika att bara mållistan presenterades i slumpmässig ordning. Vi misstänker att Nunes och Weinstein presenterade sina icke-mållistor i fallande ordning efter associativ styrka eftersom de ville framkalla fler falska minnen, vilket inte var viktigt för nuvarande syften. Observera att trots dessa förändringar betraktar vi fortfarande experiment 4 som en direkt replikering (Simons, 2014; Zwaan et al., 2017).

Cistanche-extraktpulver
Klicka här för att se produkter från Cistanche
【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Resultat
Intrång under återkallelse av lista 5
Outlier cut-off för detta experiment var 8,43 intrång (M=2.01, SD=3.21), vilket exkluderade data från fyra deltagare. Som kan ses i den vänstra panelen i fig. 8, uppvisade de testade deltagarna färre intrång (M=0.77, M=.01 i proportioner) än de icke-testade deltagarna (M {{12} }.10, M=.04 i proportioner), t(61)=3.56, p < .001, d=0.90, B10=40.74 . Detta fynd överensstämmer med våra data från experiment 1 och 2 men skiljer sig från experiment 3 och Nunes och Weinstein (2012). De kritiska falska återkallelsedata skilde sig också från experiment 3 och Nunes och Weinstein. Specifikt reducerade interpolerad testning kritiskt falskt återkallande (Mtest=0.03, Mno-test=0.10), t(61)=2.51, p=.015 , d=0.64, B10=3.46. Det är möjligt att avsaknaden av motvikt i Experiment 3 och Nunes och Weinstein bidrog till nolleffekten av testning på intrång och kritiskt falskt återkallande.

Fig. 8 Frekvens av intrång under återkallande av lista 5 (vänster) och andel av korrekt återkallande av lista 5 (höger) som en funktion av mellanliggande uppgift och PI-nivå i experiment 4. Felstaplar visar beskrivande 0,95 konfidensintervall. Jitter introducerades för att sprida datapunkter horisontellt för att öka synligheten för datapunkterna
Lista 5 korrekta återkallelser
Den högra panelen i fig. 8 visar medelandelen av lista 5 korrekt återkallande. Genom att spegla resultaten från experiment 3 visade deltagarna i testtillståndet (M=.51) mycket överlägsen prestanda jämfört med de i testtillståndet utan test (M=.17), t(61)=5.60, p < .001, d=1.42, B10=23280.95. Detta är faktiskt en mycket stor effekt och det ger exceptionellt starka bevis till förmån för den alternativa hypotesen.
Återigen fanns det en negativ korrelation mellan intrång och korrekt återkallelse (se fig. 9), r(61)=-.36, p=.004, B10=8.36. När vi delade upp data efter villkor var korrelationen inte signifikant i något av villkoret utan test, r(27)=-.27, p=.160, B01=1.69 , eller testvillkoret, r(27)=-.02, p=.905, B01=4.66. Men mönstret liknade experiment 1 och 2, med den högre korrelationen som visas i kontrolltillståndet, och otillräcklig effekt är sannolikt orsaken till dessa icke-signifikanta resultat.
Kombinerade analyser
I det följande rapporterar vi metaanalyser som kombinerade data från våra fyra experiment och de två experimenten i Nunes och Weinstein (2012). Vi genomförde en metaanalys med fasta effekter baserad på mållistans korrekta återkallningsprestanda. Vi kodade varje hög-PI- och låg-PI-tillstånd som ett separat urval, och den totala metaanalytiska effektstorleken för den framåtriktade testeffekten över dessa prover var d=0.89, Z=4.63 , p < 0,001. En moderatoranalys med nivån av PI som variabeln av intresse visade att skillnader i PI inte påverkade storleken på framåttestningseffekten, Z=0.41, p=.680, med High -PI (d=0.95) och Low-PI (d=.83) prover som ger jämförbara effektstorlekar. Den något mindre effektstorleken för studierna med låg PI drevs främst av införandet av Nunes och Weinsteins (2012) Experiment 2-data. När denna studie togs bort från provet var den genomsnittliga framåttestningseffekten för studierna med låg PI (d=1.01) lika stor som den för studierna med hög PI. En undersökning av skogstomten i fig. 10 visar att datapunkten från Nunes och WeinSteins experiment 2 ligger utanför konfidensintervallet för den metaanalytiska effektstorleken. Därför kan frånvaron av en framåttestningseffekt i deras Experiment 2 bero på ett urvalsfel och/eller en brist på utjämning av mållistans objekt.

Fig. 9 En spridningsplot som visar förhållandet mellan frekvensen av intrång under återkallande av lista 5 och andelen korrekt återkallande av lista 5 i experiment 4. För att förbättra synligheten för datatätheten introducerade vi jitter för att sprida datapunkterna horisontellt

Fig. 10 En skogstomt för metaanalysen. Varje datapunkt visar storleken på den framåtriktade testeffekten. Storleken på datamarkören representerar vikten av studien, och felstaplar visar 0,95 konfidensintervall
Allmän diskussion
Målet med den här studien var att tillhandahålla ett kritiskt test av frigivningen från proaktiv interferenskonto av framåttestningseffekten. I experiment 1 och 2 använde vi metoden för innehållsändring för att manipulera PI och undersökte om storleken på framåttestningseffekten varierade med PI-nivå. I experiment 3 och 4 försökte vi en direkt replikering av Nunes och Weinsteins (2012) studie, som till stor del matchade vårt låg-PI-tillstånd i experiment 1 och 2. Om interpolerad testning främjar ny inlärning genom att minska PI, bör testeffekten vara framåtriktad. reduceras eller elimineras när PI-nivån är låg, eftersom det skulle finnas lite eller ingen PI som kan reduceras ytterligare genom testning. Tvärtom, i fyra experiment fann vi att inter-plated testning konsekvent främjade ny inlärning oavsett nivån av PI som deltagarna upplevde.
Dessa resultat tyder på att även om interpolerade tester kan befria deltagarna från de negativa effekterna av proaktiv störning, är det osannolikt att denna fördel är orsaken till den framåtriktade testeffekten. Invariansen av framåttestningseffekten mot vår PI-manipulation kan verka paradoxal med tanke på att vi konsekvent observerade en negativ korrelation mellan korrekt återkallelse och intrång hos deltagare. Vid en första anblick verkar detta senare fynd stödja frigivningen från-PI-kontot eftersom en tolkning är att interpolerad testning minskar svarskonkurrens under återkallelse, vilket gör det lättare för de testade deltagarna att hämta de studerade objekten. Våra data avslöjade två problem med denna tolkning. För det första drevs den negativa korrelationen främst av de icke-testade deltagarna. För det andra och ännu viktigare, det faktum att en minskning av intrång och en ökning av korrekt återkallelse tenderar att inträffa samtidigt innebär inte orsakssamband. På liknande sätt är ett av de starkaste korrelaten för (bakåt) testningseffekten hämtningspraktik. I en metaanalys av litteraturen visade Rowland (2014) att studier som rapporterade bättre prestanda för hämtningspraktik tenderade att ge en större testeffekt. Att dra ett orsaksargument baserat på detta samband kan leda till att man förutsäger att hämtningspraktik bara skulle gynna inlärningen när den är framgångsrik, men studier har nu visat att misslyckad hämtningspraktik kan förbättra retentionen (Carneiro et al., 2018; Davis et al., 2017; Knight et al., 2012; Pyc & Rawson, 2010, 2012).

Cistanche-tillägg nära mig
På samma sätt verkar den framåtriktade fördelen med testning vara associerad med, men inte beroende av, frisättning-från-PI-effekten. Vi tror att den negativa korrelationen mellan intrång och korrekt återkallelse drivs av en tredje variabel, och en möjlig kandidat är att testning främjar semantisk organisation i minnet (Chan, Manley, et al., 2018; Zaromb & Roediger, 2010). Ny forskning har visat att, över successiva test, blir eleverna mer benägna att klustera semantiskt relaterade objekt under återkallelse, och nivån av klustring är positivt associerad med korrekt återkallningsprestanda (Chan et al., 2020; Yang et al., 2021). Vi har nyligen tillskrivit denna förbättrade minnesorganisation till deltagare som optimerar sina kodnings- och hämtningsstrategier över listor (Chan et al., 2020; Chan, Manley, et al., 2018). Även om studier i framåttestningslitteraturen endast har undersökt klustring baserat på semantiska samband, har andra studier visat att testning också kan öka temporal klustring och segregation. Specifikt kan interpolerade tester främja elevers förmåga att gruppera objekt som studerats i nära temporal närhet (dvs. objekt som studerats i samma lista), samtidigt som objekt som studerats före eller efter hämtning (dvs. objekt som studerats över listor) segregeras. et al., 2010; Chan & McDermott, 2007; Jang & Huber, 2008; Kliegl & Bäuml, 2021; Wahlheim, 2015; Yang et al., 2021). Som Darley och Murdock (1971) spekulerade, kan växling mellan en kodnings- och hämtningsuppgift ge en möjlighet för eleverna att mentalt märka eller tagga objekt baserat på om de tidigare testats eller inte (Davis et al., 2017) och denna märkningsmekanism kan minska intrång (Pierce et al., 2017) antingen genom ett tidigt urval eller sen korrigeringsmekanism. Ur perspektivet av tidigt urval, kan deltagarna begränsa sin hämtning vid fronten genom att försöka sin minnessökning genom objekt som de inte tidigare hade hämtat (Rugg et al., 2000; Shimizu & Jacoby, 2005); alternativt kan deltagarna försöka en bred minnessökning och sedan undanhålla utmatning av tidigare återkallade objekt. Den tidiga urvalsmekanismen – det vill säga begränsad hämtning – kan tjäna till att både öka korrekt återkallelse (genom att minska sökuppsättningen) och minska intrång (eftersom tidigare testade objekt inte finns i sökuppsättningen), och därigenom producera en negativ korrelation mellan dessa beroende variabler .
Nyligen har forskare hävdat att den PI-reducerande effekten av hämtning bidrar till den framåtriktade testeffekten (Dang et al., 2021; Yang et al., 2021). Stöd för detta argument baserades på en medlingsanalys där intrång från tidigare lista fungerade som en signifikant mediator mellan den oberoende variabeln för interpolerad aktivitet (dvs. testning kontra omstudie) och den beroende variabeln för korrekt återkallelse, och forskarna tolkade detta indirekta. effekt som hämtning isolerar elever från PI, vilket i sin tur främjar nyinlärning. Vi varnar dock för en sådan tolkning i det aktuella fallet eftersom det inte fanns någon tidsmässig företräde mellan medlaren (dvs. intrång) och den beroende variabeln (dvs korrekt återkallelse). Istället sker intrång och korrekt återkallelse under samma experimentella fas, vilket gör det omöjligt att sluta sig till kausalitet via tidsordningar (dvs något som inträffar senare kan inte orsaka något som inträffar tidigare; Aalen et al., 2012; Hayes, 2018; Preacher, 2015 ; Walters, 2019). Det är faktiskt möjligt att vända rollerna för medlaren och den beroende variabeln i analyserna utförda av Dang et al. (2021) och Yang et al. (2021), så att korrekt återkallande fungerar som mediator och intrång fungerar som beroende variabel. För att utforska denna möjlighet genomförde vi en medlingsanalys med hjälp av data som Dang et al. och Yang et al. tillhandahålls i Open Science Framework.
Vi försökte först replikera deras ursprungliga medlingsanalyser, och resultaten av vår modell överensstämde med deras, så att det fanns en signifikant indirekt effekt av intrång på korrekt återkallelse.2 Vi undersökte sedan lönsamheten för den omvända medlingsmodellen. Som vi hade misstänkt var den indirekta effekten av denna omvända modell också signifikant, -0.238 [-0.418, -0.112] i Dang et al., och {{7 }}.942 [-1.217, -0.666] i Yang et al., vilket indikerar att interpolerad testning påverkar tidigare listintrång genom korrekt återkallelse. Betydelsen av denna omvända modell belyser svårigheten att tolka resultaten av en medlingsanalys där mediatorn och den beroende variabeln inte har någon tydlig tidsmässig företräde.
Vi skulle vara försumliga att inte nämna att Chan, Manley, et al. (2018) föreslog att interpolerade tester kan förbättra ny inlärning i inlärningsparadigmet för kategoriserade listor genom att öka sannolikheten för att deltagarna skulle lägga märke till listornas kategoriserade karaktär. Tanken är att när deltagarna inser listornas kategoriserade karaktär, skulle de försöka koda det semantiska förhållandet över liknande listobjekt, vilket borde förbättra inlärningen. Chan et al. resonerade vidare att, om denna hypotes är korrekt, borde göra den kategoriserade karaktären hos listan lätt upptäckbar (t.ex. genom att presentera ord från samma kategori i block) minska fördelen med framåttestning, och de citerade Nunes och Weinstein (2012) som tillhandahållande preliminärt stöd för en sådan hypotes. De nuvarande resultaten strider klart mot dessa förutsägelser.
Begränsningar
En begränsning av denna studie är att endast hämtningsformen av PI togs upp eftersom vi mätte intrång. Men kodning kan också påverkas av uppbyggnaden av PI eftersom elevernas uppmärksamhetsresurser kan försämras när de fortsätter att koda information. Till exempel, i en EEG-studie, rapporterade Pastötter och kollegor (2011) att interpolerade tester förbättrade kodningen av ny information genom att minska ouppmärksamheten, vilket framgår av en ökning av alfakraften (en elektrofysiologisk korrelation av ouppmärksamhet) över listor för kontrolldeltagarna, men inte för de testade deltagarna. Vidare visade Szpunar och kollegor (Szpunar et al., 2013; Jing et al., 2016; se även Pan et al., 2020, för en liknande finansiering med förtestning snarare än interpolerad testning) att när man tittade på en videoinspelad föreläsning , deltagare som fick ett interpolerat test var 5:e minut var mycket mindre benägna att rapportera sinnesvandring än kontrolldeltagare. Men, som nämnts tidigare, anser vi att sådana uppmärksamhetsbaserade mekanismer bör behandlas som åtskilda från release-från-PI-kontot eftersom att tillåta detta konto att inkludera uppmärksamhets-/kodningsbaserade mekanismer skulle göra kontot för brett och svårt att förfalska.
Våra studier, liksom många beteendestudier, tillät oss inte heller att särskilja kodnings- och hämtningsbaserade effekter, eftersom vår kodningsmanipulation (dvs. High-PI vs. LowPI) kunde, och sannolikt hade, en kaskadeffekt på hämtning. Framtida studier kan försöka riva isär kodnings- och hämtningseffekterna av framåttestningseffekten med hjälp av hjärnavbildning eller elektrofysiologiska metoder som tillhandahåller realtidsdata under kodning (Pastötter et al., 2011; se även Beardsley et al., 2018).
En annan fråga vi vill ta upp är den operativa definitionen av PI. I de aktuella experimenten har vi använt frekvensen av intrång som ett mått på PI, liksom de flesta studier i litteraturen om framåttestande effekt. Men i den verbala inlärningseran användes korrekt återkallningsprestanda regelbundet för att demonstrera PI-effekter. Till exempel, när man jämförde minnesprestanda mellan deltagare som studerade en enda AD-lista (utan tidigare studie) mot deltagare som studerade en AB-lista före AD-listan, ansågs en minskning av AD-återkallelse på grund av tidigare inlärning som bevis för PI. Genom att anta denna definition kan man hävda att vår PI-manipulation inte har haft någon inverkan eftersom kontrolldeltagarna konsekvent visade sämre korrekt återkallningsprestanda på mållistan i förhållande till List 1-återkallningsprestanda för de testade deltagarna (vilket motsvarar en grupp av deltagare som hade ingen tidigare studie, se tabell 1). Att anta denna definition av PI för den framåtriktade testningseffekten skulle emellertid göra redovisningen från PI rent beskrivande (snarare än förklarande), eftersom varje gång en framåttestningseffekt hittas måste deltagare i det testade tillståndet per definition överträffa de i kontrollvillkoret. Att hävda en sådan skillnad som release-from-PI upprepar helt enkelt, snarare än förklarar, fenomenet.
Slutligen erkänner vi att vår urvalsstorlek var för liten för att upptäcka en interaktion mellan interimsaktivitet och PI-nivå. Om en måttlig effektstorlek (t.ex. f=0,2) antogs för interaktionseffekten med en alfanivå på 0,05 och 0,80, skulle en total urvalsstorlek på 199 deltagare ha krävts. Man kan märka att den framåtriktade testeffektstorleken var mindre i låg-PI-tillståndet än i hög-PI-tillståndet från både experiment 1 (låg-PI =.14, hög-PI=.20 ) och Experiment 2 (Låg-PI=.23, Hög-PI=.31), och en tolkning av dessa icke-signifikanta skillnader är att den framåtriktade testeffekten var mindre uttalad när deltagarna upplevde mindre PI. Vi varnar dock för att övertolka skillnader baserat på råa sannolikheter eftersom de inte tar hänsyn till skillnader i datavariabilitet. När vi undersöker samma data med Cohens d, blir det tydligt att skillnaderna i procent är mer uppenbara än verkliga. Specifikt är den framåtriktade testeffekten 0,81 i låg-PI-tillståndet och 0,82 i hög-PI-tillståndet i experiment 1, 1,09 i låg-PI-tillståndet och 1,20 i tillståndet med högt PI i experiment 2. Icke desto mindre, det är fortfarande möjligt att interaktionen mellan PI-tillståndet och interimaktivitet inte var signifikant på grund av låg statistisk kraft. Med andra ord, release-from-PI kan ha bidragit lite till den framåtriktade testeffekten, men våra experiment var inte tillräckligt kraftfulla för att upptäcka det. Således skulle framtida forskning som undersöker sambandet mellan PI-nivå och interimsaktivitet dra nytta av ett större urval.
Slutord
I de aktuella experimenten tillhandahöll vi ett kritiskt test av release-från-PI-kontot, som allmänt anses vara en av de viktigaste kandidatförklaringarna till den framåtriktade testeffekten. I fyra experiment observerade vi konsekvent data som bryter mot dess förutsägelser. Viktigt är att vi misslyckades med att replikera Nunes och Weinsteins (2012) finansiering, som hittills tillhandahöll det avgörande beviset för release-fromPI-kontot. Åtminstone tyder våra data på att om frisläppning från PI skulle bidra till den framåtriktade testeffekten, spelar den sannolikt en mindre roll än tidigare förväntat.
Eftersom vår studie utformades för att testa hypotesen om frisättning från PI, kunde den inte ta upp frågan om "om frisättning från proaktiv interferens inte är en orsaksfaktor för den framåtriktade testningseffekten, vad är det?" Lyckligtvis finns flera potentiellt genomförbara förklaringar kvar. Till exempel kan interpolerade tester potentiera ny inlärning genom att främja uppmärksam kodning (Chan et al., 2020; Szpunar, 2017; Szpunar et al., 2013; Weinstein et al., 2014). En annan möjlighet är att testning kan göra det möjligt för eleverna att utveckla effektivare kodnings-/hämtningsstrategier som drar fördel av bättre minnesorganisation (Chan et al., 2020; Dang et al., 2021) eller kontextuell segregation (Yang et al., 2021). Framtida forskning som direkt tar itu med dessa konton kommer att bidra till att främja vår förståelse av den framåtriktade testeffekten.
Referenser
Aalen, OO, Røysland, K., Gran, JM, & Ledergerber, B. (2012). Kausalitet, medling och tid: En dynamisk synvinkel. Journal of the Royal Statistical Society. Serie A: Statistics in Society, 175(4), 831–861. https://doi.org/10.1111/j.1467-985X.2011. 01030.x
Bäuml, KHT, & Kliegl, O. (2013). Den kritiska rollen för hämtningsprocesser i frigörandet från proaktiv störning. Tidskrift för minne och språk, 68(1), 39–53. https://doi.org/10.1016/j. jml.2012.07.006
Beardsley, M., Hernández-Leo, D., & Ramirez-Melendez, R. (2018). Söka reproducerbarhet: Bedöma en multimodal studie av testeffekten. Journal of Computer Assisted Learning, 34(4), 378-386. https://doi.org/10.1111/jcal.12265
Bonner, SM (2009). Undersöker lärarens användning av övningsprov i formativt syfte. Journal of Multidisciplinary Evaluation, 6(12), 125-136.
Brewer, GA, Marsh, RL, Meeks, JT, Clark-Foos, A., & Hicks, JL (2010). Effekterna av testning av fritt återkallande på efterföljande källminne. Minne, 18(4), 385–393. https://doi.org/10. 1080/09658211003702163
Brown, J. (1958). Några tester av förfallsteorin om det omedelbara minnet. Quarterly Journal of Experimental Psychology, 10(1), 12–21.https://doi.org/10.1080/17470215808416249
Carneiro, P., Lapa, A., & Finn, B. (2018). Effekten av misslyckad hämtning på barns efterföljande lärande. Journal of Experimental Child Psychology, 166, 400–420. https://doi.org/10. 1016/j.jecp.2017.09.010
Chan, JCK, & McDermott, KB (2007). Testeffekten i igenkänningsminne: Ett konto med dubbla processer. Journal of Experimental Psychology: Learning Memory and Cognition, 33(2), 431–437.https://doi.org/10.1037/0278-7393.33.2.431
Chan, JCK, Manley, KD, & Lang, K. (2017). Återvinningsförstärkt suggestibilitet: En retrospektiv och en ny utredning. Journal of Applied Research in Memory and Cognition, 6(3), 213–229. https://doi.org/10.1016/j.jarmac.2017.07.003
Chan, JCK, Manley, KD, Davis, SD, & Szpunar, KK (2018). Testning potentierar ny inlärning över ett retentionsintervall och en fördröjning: Ett strategibyteperspektiv. Journal of Memory and Language, 102(maj), 83–96. https://doi.org/10.1016/j.jml. 2018.05.007
Chan, JCK, Meissner, CA, & Davis, SD (2018). Retrieval potentierar nytt lärande: En teoretisk och metaanalytisk översikt. Psychological Bulletin, 144(11), 1111–1146. https:// doi.org/10.1037/bul0000166
Chan, JCK, Manley, KD, & Ahn, D. (2020). Potentierar hämtning ny inlärning när hämtning upphör men ny inlärning fortsätter? Journal of Memory and Language, 115(juli), 104150. https://doi.org/10.1016/j.jml.2020.104150
Conway, ARA, Kane, MJ, Bunting, MF, Hambrick, DZ, Wilheim, O., & Engle, RW (2005). Arbetsminnesspan-uppgifter: En metodologisk granskning och användarhandledning. Psychonomic Bulletin and Review, 12(5), 769–786. https://doi.org/10.1021/ can-v020n021.p1399
Dang, X., Yang, C., & Chen, Y. (2021). Åldersskillnad i den framåtriktade testeffekten: Strategins roller förändras och frigörs från proaktiv störning. Kognitiv utveckling, 59 (juni), 101079.https://doi.org/10.1016/j.cogdev.2021.101079






