Ga naar de hoofdinhoud

We gebruiken cookies om te begrijpen hoe bezoekers onze site gebruiken en om deze te verbeteren. Je kunt je keuze op elk moment wijzigen. Lees meer in ons privacybeleid.

RAG-ontwikkelingsabonnement

AsyncForge bouwt productie-RAG-systemen met senior engineers vanaf €2.000/maand – juiste chunking, hybride zoeken, herrangschikken en citatieweergave.

De meeste RAG-systemen halen de verkeerde documenten op

RAG (Retrieval-Augmented Generation) is tegenwoordig het meest voorkomende LLM-patroon in de productie. De pitch is eenvoudig: sluit je documenten in, haal de relevante op voor elke zoekopdracht, stop ze in de prompt en genereer ze. De realiteit is complexer: de meeste RAG-systemen halen middelmatige resultaten op, en de LLM-antwoorden speels op basis van wat er ook maar opdook, waarbij ze hallucineerden waar het ophalen miste.

Chunking is de meest overgeslagen optimalisatie. Naïeve brokken van 1000 tekens splitsen zinnen en concepten. Beter: verdeel de semantische grenzen (paragrafen, koppen, codeblokken) en overlappen de delen met 100-200 tekens om de context te behouden. Nog beter: sla het deel plus de metagegevens van het bovenliggende document op, zodat de LLM een pad naar de bron heeft.

Hybride zoeken verslaat puur semantisch zoeken. Vectorovereenkomst is geweldig voor "documenten over X vinden", maar slecht voor "documenten vinden die de exacte zin Y bevatten". BM25 (zoeken op trefwoord) is het omgekeerde. Het combineren ervan – RRF (reciprocal rank fusion) of gewogen score – levert een dramatisch betere ophaalmogelijkheid op dan elk afzonderlijk.

Herrangschikking is de RAG-verbetering met de hoogste impact. Nadat het aanvankelijk ophalen 50 kandidaten heeft geretourneerd, scoort een cross-encoder-reranker (Cohere Rerank, Voyage Rerank of open-source) de top 50 op basis van de zoekopdracht en retourneert de top 5. De reranker heeft volledige aandacht voor zowel documenten als zoekopdrachten, in tegenstelling tot het inbedden van gelijkenis die beide in vectoren comprimeert. Resultaat: top-5 kwaliteit maakt een flinke sprong.

AsyncForge heeft senior engineers die productie-RAG-systemen verzenden. Dien documentladers, chunkingstrategieën, ophaalpijplijnen, rerankers, evaluaties of volledige RAG-builds in. Licht 4 dagen, Standaard 48 uur, Pro 1 dag.

Wat je krijgt

Slim chunken

Semantische grenssegmenten met overlap, behoud van metagegevens, hiërarchisch (bovenliggende en onderliggende documenten) indien nuttig.

Hybride zoeken

BM25 + inbedding van gelijkenis gecombineerd via RRF. Per query, niet per document. Aanzienlijk beter dan beide alleen.

Herrangschikking

Cohere Rerank, Voyage Rerank of open-source cross-encoder. Top-50 → top-5 met veel betere kwaliteit.

Citatieweergave

LLM-antwoorden bevatten bronvermeldingen die zijn gekoppeld aan de originele documentfragmenten. Gebruikers kunnen verifiëren, niet alleen vertrouwen.

Eval-suite

Evalueer een set vraag-antwoordparen met verwachte bronnen. Retrieval recall@5, antwoordgetrouwheid, antwoordrelevantie – allemaal gemeten in CI.

Multimodale RAG

Wanneer de bron pdf's met diagrammen of gescande formulieren zijn, gebruiken we visiebewuste extractie (Unstructured, AWS Textract, Anthropic vision).

Technologieën die we gebruiken

pgvectorPineconeQdrantWeaviateCohere RerankVoyage AILlamaIndexUnstructured.io

Hoe het werkt met AsyncForge

1

Abonneer je

Plan gekozen.

2

RAG-werk indienen

Chunking, ophalen, herrangschikken, evaluaties, volledige pijplijnen.

3

Wij leveren

Geëvalueerd, geciteerd, productie-grade.

4

Herhaal

Onbeperkt revisies.

Veelgestelde vragen

pgvector of dennenappel?
pgvector voor de meeste apps. Pinecone wanneer je hun UI/ops nodig hebt of wanneer de schaal de Postgres-limieten overschrijdt.
Herschikking – noodzakelijk?
Bijna altijd ja. Het top-5 kwaliteitsverschil is de meest opgemerkte verbetering die gebruikers noemen.
Citaties?
Ja. We geven gestructureerde citaten weer die teruglinken naar bronfragmenten.
Evaluaties?
Vereist. Wij verzenden geen RAG zonder evaluatiesuite in CI.
Multimodaal?
Ja – PDF + afbeelding + tabelextractie met vision-bewuste tooling.

AsyncForge werkt alleen op uitnodiging

We werken met een klein aantal founders tegelijk. Nieuwe klanten starten na een kennismaking van 15 minuten met Stef — vraag die hieronder aan.