Cas 0

Ens ho apliquem a nosaltres, i ensenyem els errors.

SerIA Nativa es va construir amb aquest mateix mètode. Les dades són verificables.

576fragments indexats, de 74 documents
94%de recuperació amb la font correcta
242 msde latència mitjana
0resultats rellevants a les preguntes trampa

Recompte del 23/08/2026 · qualitat mesurada el 20/08/2026 · el sistema es reindexa sol a cada canvi

En clar · què volen dir aquestes xifres

576 fragments de 74 documents. La nostra documentació no s’hi guarda com a fitxers sencers, sinó tallada en trossos d’un o dos paràgrafs. Així el sistema pot portar-vos el paràgraf que respon, i no un document de quaranta pàgines perquè el busqueu vosaltres. La xifra puja cada setmana, perquè el sistema es reindexa a cada canvi.

94%. Vam preparar vint preguntes: disset amb resposta dins la documentació i tres de trampa, inventades, que no en tenien cap. El sistema va trobar el document correcte i va citar la font en setze de les disset. A les tres trampes no es va inventar res, que és el que estàvem comprovant de debò.

242 ms. El temps que triga a buscar: un quart de segon.

El que aquestes xifres no mesuren: si la frase que redacta després està ben escrita. És una altra cosa, encara no la mesurem, i el dia que ho fem ho direm aquí amb la data al costat.

Fulls de producció clavats a la paret mentre un operari treballa en un torn
Els fulls de la paret ja són dades, i algú els mira cada dia. La diferència no és tenir més números: és poder dir què mesura cadascun, que és el que intentem fer amb els nostres.Imatge generada amb IA · SerIA Nativa

Dues troballes que preferim explicar

La bateria ens va fer descobrir un error nostre: amb la configuració inicial l’examen donava 82%, i el nostre primer diagnòstic de la causa va ser incorrecte. Vam arribar a esborrar de l’índex un document legítim per no verificar la ruta que el mateix sistema ens donava. Es va recuperar íntegre a la reindexació següent i la causa real va resultar ser una altra: el sistema només mirava els tres primers documents candidats de cada cerca, i n’havia de mirar cinc. Canviat aquell número, el resultat va pujar al 94% sense tocar res més.

La lliçó va quedar escrita com a norma: en un sistema així, el risc no és només que s’equivoqui la màquina; és que ens equivoquem nosaltres interpretant-la.

L’inventari de seguretat va destapar sis fitxers amb claus d’API llegibles per qualsevol usuari del servidor. Corregits el mateix dia.

Ensenyem això a propòsit. Un sistema que detecta els seus propis errors és més fiable que un que no en reporta mai cap.