Aller au contenu principal

Per què compren llibres vells per destruir-los? El secret que ningú t'explica sobre l'entrenament de la IA

Desmuntant el mite de l'algoritme: si tots els models fan servir la mateixa arquitectura, el valor real és allò que no està a internet.

Fa uns dies llegia una notícia a 3cat.cat que m'ho va confirmar tot: les llibreries de vell estan rebent comandes sospitoses i massives. Compradors anònims que s'enduen lots sencers de llibres descatalogats, revistes antigues o enciclopèdies polsegoses. El destí d'aquest patrimoni? Escanejar-los, extreure'n el text per alimentar les bèsties de la Intel·ligència Artificial i, un cop extret el suc, destruir-los o llençar-los.

És la materialització d'una crisi silenciosa: a la IA se li ha acabat internet.

Per entendre per què estem arribant a l'extrem de comprar i destruir llibres físics, primer hem de desmuntar el gran engany del màrqueting tecnològic: el mite de l'algoritme miraculós.

L'esquelet és el mateix per a tothom

Sovint es ven la idea que un model d'IA és "més intel·ligent" que un altre perquè els seus creadors han inventat un codi secret o una matemàtica revolucionària. La realitat, des del punt de vista tècnic, és molt més terrenal.

La immensa majoria de grans models de llenguatge (LLMs) que coneixem i fem servir es basen en la mateixa arquitectura d'aprenentatge profund: el Transformer, basat en el mecanisme d'atenció (attention mechanism). Aquesta arquitectura, que va marcar un punt d'inflexió fa uns anys, permet al model "prestara atenció" a les parts més rellevants d'una seqüència de dades per entendre el context.

Com funciona realment? El mecanisme d'atenció explicat senzill

Imagina que llegeixes la frase: "El gos va perseguir la pilota perquè estava entrenat per fer-ho." Quan la IA llegeix això, el mecanisme d'atenció li permet centrar-se en les paraules clau ("gos", "persegueix", "entrenat") per entendre que "estava" es refereix al gos, i no a la pilota. Ignora o dona menys importància a paraules de farciment. Aquesta capacitat de "saber què és important en cada moment" és el que fa que el model entengui el context i generi una resposta coherent, en lloc de limitar-se a endevinar la següent paraula.

La propera revolució de la IA no serà qui tingui el millor algoritme, sinó qui sàpiga rescatar, organitzar i protegir el coneixement profund, físic i humà que hem donat per oblidat.

Si gairebé tots els models comparteixen el mateix "esquelet" o arquitectura, per què un model et dona respostes molt millors, més matisades i més útils que un altre?

La resposta no és l'algoritme. La resposta és la dieta. És a dir, les dades amb què l'has entrenat.

La fam de coneixement "Offline"

Els models d'IA ja s'han "menjat" gairebé tot el text públic, d'alta qualitat i divers que hi havia a internet. El que queda a la web sovint és soroll, contingut generat per altres IA (creant un cercle viciós de col·lapse de model) o informació superficial.

Per aconseguir que un model destaqui, les grans tecnològiques necessiten coneixement que no està a internet. Necessiten el món físic. Necessiten llibres vells, arxius històrics, manuscrits, diaris en paper i bases de dades privades que mai s'han digitalitzat. D'aquí ve la desesperació per comprar lots de llibres de vell: estan buscant l'or negre del coneixement humà offline. I el fet que sovint els destrueixin un cop digitalitzats demostra una visió purament extractivista del coneixement: el llibre com a objecte cultural no té valor per a ells; només val la matriu de vectors que poden extreure'n.

Ara és quan cal posar els cinc sentits al nostre tresor amagat

Aquesta fam de dades "offline" té una lliçó fonamental per a les empreses i institucions. Des de la metodologia AURA, sempre insisteixo en el mateix: el vostre avantatge competitiu no serà pagar per la API d'un model d'IA més car o més de moda. Tothom pot accedir als mateixos Transformers.

El vostre avantatge competitiu és allò que la vostra organització sap i que no és a internet.

El veritable valor per a la IA aplicada rau en:

  • El coneixement tàcit: L'experiència dels vostres equips veterans, els "trucs" per resoldre problemes que mai s'han escrit en cap manual.
  • Els arxius morts: Aquells PDFs, Word o fins i tot papers a l'arxiu amb processos interns, errors passats i solucions pròpies del vostre sector.
  • Les vostres dades privades: La interacció real amb els vostres clients, els vostres fluxos de treball reals.

Si la vostra empresa vol introduir la IA de manera segura i útil (la Fase A d'Anàlisi i la Fase U d'Ús Estratègic d'AURA), el primer pas no és buscar quina eina és més potent. El primer pas és preguntar-se: Quin coneixement exclusiu tenim tancat als calaixos, als servidors locals o al cap de la nostra gent, que cap model d'IA generalista coneix?

La IA no és màgia; és un mirall. I si li donem el mateix reflex de sempre, només ens tornarà més del mateix. El repte és ensenyar-li allò que només nosaltres sabem.

0 Vues
0 Commentaires

Commentaires

Ajouter un commentaire

HTML restreint

  • Balises HTML autorisées : <a href hreflang> <em> <strong> <cite> <blockquote cite> <code> <ul type> <ol start type> <li> <dl> <dt> <dd> <h2 id> <h3 id> <h4 id> <h5 id> <h6 id>
  • Les lignes et les paragraphes se coupent automatiquement.
  • Les adresses de pages web et les adresses courriel se transforment en liens automatiquement.