Historische bronroute
Gebruik dit archief voor controleerbare bronnen uit 1816–2009. Voor actuele stukken en dossierlijnen vanaf 2009 gebruikt u
Bronnen kiezen; voor een actuele bestuurlijke notitie
Voorbereiding; voor letterlijke vergaderuitspraken
Vergaderkennis. Historische OCR is een zoekingang en geen zelfstandig formeel bewijs.
Wat is dit Archief?
Het Historisch Archief is een lokale catalogus van 2.871 historische banden, raadsverslagen en besluitboeken over bijna twee eeuwen stadsgeschiedenis (1816 t/m 2009). Het ontsluit Schiedam en de voormalige zelfstandige gemeenten Kethel en Spaland, Nieuwland en Kortland en Oud- en Nieuw-Mathenesse.
Hoe kun je het archief doorzoeken?
- 📅 Chronologisch bladeren: Gebruik de Tijdperken-pills bovenaan om direct te springen naar bijv. 1851-1900 (De Gouden Jenevereeuw).
- 🔎 Eén zoekregel, twee bronnen: iedere zoekopdracht doorzoekt zowel de OCR-scantext van afzonderlijke PDF-pagina's als de catalogusmetadata. U hoeft niet vooraf te kiezen.
- 📑 Inhoudelijke woorden: gebruik onderwerpen, locaties, straatnamen, personen en historische termen, bijvoorbeeld jenever, verkeer, Lange Haven of een familienaam. Deze worden vooral in de scantext gevonden.
- 🗂️ Cataloguswoorden: gebruik een documenttitel, bestuurslichaam of jaartal, bijvoorbeeld notulen, Schiedam, Kethel of 1853. Deze leveren daarnaast passende cataloguskaarten op.
- 🔤 Historische spelling: probeer bij weinig treffers ook oude of alternatieve schrijfwijzen en een kortere woordstam. OCR van oud drukwerk en handschrift kan letters verkeerd herkennen.
- 🏛️ Voormalige Gemeenten: Filter in 1 klik op archiefboeken van Kethel en Spaland, Mathenesse of Nieuwland.
- 📖 Officiële scan: klik op een kaart en open daarna de authentieke scan bij het officiële Schiedams archief.
Kernwoorden, woordcombinaties en volledige zinnen
De zoekregel accepteert niet alleen één kernwoord. U kunt ook meerdere woorden, een kenmerkend zinsdeel of een volledige historische zin invoeren. Een langere invoer wordt opgesplitst in maximaal twaalf zoekwoorden; een scanpagina moet deze woorden bevatten om als resultaat te verschijnen.
De woorden hoeven momenteel niet exact naast elkaar of in dezelfde volgorde te staan. De functie vindt dus controleerbaar woorden in de aangetroffen OCR-tekst, maar beoordeelt nog niet zelfstandig de betekenis van een moderne vraag.
Voorbeelden van bruikbare zoekopdrachten
- jenever
- aanleg nieuwe weg
- onderhoud Lange Haven
- de burgemeester deelt mede
- is besloten het verzoek toe te staan
- verzoek tot oprichting van een jeneverstokerij
- de kosten der bestrating van de weg
- benoeming van leden van de gemeenteraad
Zoek bij voorkeur met kenmerkende historische woorden. Gebruik bijvoorbeeld bestrating weg Kethel in plaats van de moderne vraag Wat heeft de gemeenteraad besloten over de bestrating van de weg naar Kethel? Vraagwoorden als ‘wat’, ‘waarom’ en ‘wanneer’ moeten anders ook letterlijk op de scanpagina voorkomen.
Bij weinig treffers kunt u de invoer stapsgewijs verkorten: verzoek tot oprichting van een jeneverstokerij → oprichting jeneverstokerij → jeneverstokerij → jenever. Probeer ook oude spelling, een alternatieve schrijfwijze of een kortere woordstam, omdat OCR historische letters soms verwisselt.
Terugkerende bestuurlijke formuleringen kunnen eveneens worden onderzocht, zoals voor kennisgeving aangenomen, zonder hoofdelijke stemming besloten, de voorzitter opent de vergadering en ter tafel gebracht en overwogen.
Mogelijke verdere verdieping: een latere semantische zoeklaag zou moderne vragen kunnen verbinden aan historische formuleringen en spellingvarianten. De huidige zoekfunctie blijft bewust een transparante tekstzoeker: de gevonden woorden, pagina en officiële scan zijn direct controleerbaar.
Bronbegrenzing: de catalogusdatabase bevat metadata en korte omschrijvingen, geen gedownloade PDF-verzameling en geen volledige OCR. De afzonderlijke scantextindex bevat alleen werkelijk aangetroffen paginagebonden tekstlagen met herkomst en kwaliteitsstatus. Controleer inhoud en paginanummer altijd in de officiële scan.
Kosteloze eerste fase: bestaande OCR maximaal hergebruiken
Van de 2.871 catalogusrecords zijn alle 2.821 PDF-kandidaten gecontroleerd. De overige 50 records verwijzen naar VideoTulen uit 2006–2009 en blijven in de afzonderlijke vergaderingenpijplijn. De PDF's blijven bij NotuBiz en worden niet permanent lokaal bewaard.
Gemeten staat van het PDF-archief
- 2.821 van 2.821 documenten verwerkt, zonder verwerkingsfouten.
- 139.178 pagina's geïnventariseerd; op 138.451 pagina's is tekst aangetroffen.
- Documentniveau: 2.413 compleet, 106 compleet met kwaliteitswaarschuwingen, 288 gedeeltelijk en 14 zonder tekstlaag.
- Paginaniveau: 126.290 veel tekst, 11.384 bruikbaar, 335 schaars, 271 mogelijk verminkt, 171 leeg/omslag en 727 zonder tekstlaag.
- De index bevat circa 308 miljoen tekens en 50,5 miljoen woorden. Zoeken is breed mogelijk, maar OCR is geen gegarandeerd foutloze transcriptie.
Iedere PDF is via de officiële NotuBiz-API tijdelijk opgehaald en gecontroleerd op document-ID, versie en hash. Alleen tekst, paginanummer, kwaliteitsstatus en bronidentiteit staan in de aparte SQLite-FTS-index. Namen, data en letterlijke citaten moeten bij twijfel altijd naast de officiële scan worden gecontroleerd.
Kosten en capaciteit: deze eerste route gebruikt de OCR die al in de PDF aanwezig is en vraagt daarom geen aanvullende AI-verwerking en geen GPU. Wel zijn tijdelijke downloadruimte, CPU-tijd, netwerkcapaciteit en een beheerste officiële leesstroom nodig. Na de eenmalige opbouw kan later een nachtelijke delta alleen nieuwe of gewijzigde versies verwerken.
Gemeentevoorstel fase 2: ontbrekende of onvoldoende betrouwbare tekst
Aanvullende OCR of AI-handschriftherkenning is nodig bij pagina's zonder tekstlaag, maar ook wanneer de bestaande OCR door oud handschrift, historische lettervormen, scanruis of herkenningsfouten onvoldoende betrouwbaar is. Gerichte herverwerking van zulke pagina's verbetert de vindbaarheid van onderwerpen, locaties, personen en historische schrijfwijzen. De officiële scan blijft altijd de bron voor controle.
Verschil in herkenningskwaliteit
- Standaard-OCR is geschikt voor scherp, gedrukt schrift. Bij oude lettervormen, verkleuring, beschadigde pagina's en handschrift ontstaan vaker verkeerde letters, woorden en namen.
- Gespecialiseerde historische handschriftherkenning gebruikt scans op hogere resolutie, beeldverbetering en modellen met historische taalcontext. Daardoor worden oud-Nederlandse spelling en afwijkende lettervormen aanzienlijk beter herkend.
- Hoogst haalbare kwaliteit vraagt daarnaast een tweede controlepassage en menselijke verificatie van namen, data en moeilijk leesbare passages. Onzekere lezingen blijven zichtbaar gemarkeerd en worden nooit als vaststaand feit gepresenteerd.
Deze hoogste kwaliteitsroute vergt meer rekencapaciteit, verwerkingstijd, AI-gebruik en specialistische controle. Hiervoor moet vooraf een afzonderlijk gemeentelijk budget worden vastgesteld, met afspraken over gewenste nauwkeurigheid, maximale kosten en welke ontbrekende pagina's prioriteit krijgen.
Advies: benut eerst alle reeds aanwezige OCR kosteloos. Start fase 2 daarna met een representatieve proefcollectie van ontbrekend drukwerk en moeilijk handschrift, meet herkenningskwaliteit en kosten per pagina, en schaal pas op binnen een afgesproken plafond.