De de les barroeres traduccions dels anys 60 fins al sistemes actuals de xat basats en “intel·ligència artificial”. Després d ‘explicar-nos que “Els ordinadors no entenen res, nosaltres sí“, amb aquest segon article, Narcís Bassols ens proposa un breu viatge per la tecnologia de sis dècades

DE L’ARANÈS A L’ÀZERI: UNA PANORÀMICA DE LA TRADUCCIÓ AUTOMÀTICA

Va ser als anys 60 que, en plena guerra freda, els americans van crear els primers (i molt rudimentaris) sistemes de traducció per ordinador per a traduir del rus a l’anglès. La baixa qualitat dels resultats va fer entendre alguns problemes de la traducció automàtica, com ara la impossibilitat de traduir paraula per paraula tal com aquestes estan posades a la frase. Ai las, la sintaxi! Com es pot traduir paraula per paraula si hi ha termes o estructures que no són equivalents entre dos idiomes? Els pronoms febles catalans, per exemple, no tenen cap equivalència en castellà o portuguès (però sí que la tenen en occità i en francès). Si la traducció “paraula per paraula” entre llengües tan semblants ja és complicada, què es pot esperar d’una traducció automàtica polonès-armeni o irlandès-hindi (o vice-versa)?

Per tant, el programa de traducció no només havia de tenir coneixement lèxic (cadira  chair) sinó també morfològic (“jo sé”, no pas “jo sabo”) i a més sintàctic. En les dècades posteriors, amb els primers sistemes de traducció automàtica al mercat, els informàtics i els lingüistes se centraren en desenvolupar “coneixement lingüístic” per a les màquines. Als anys 90, la tecnologia permetia traduir amb una fiabilitat mitjana un document d’un àmbit lingüísticament limitat, normalment tècnic. Eren sistemes cars, que compraven empreses que necessitaven traduir grans volums de text, com ara manuals d’usuari en diversos idiomes. Després de l’ordinador, un humà havia de repassar el text i treure’n les inconsistències. Es va començar a albirar la utilitat dels traductors automàtics: fan la feina “gruixuda” però cal que tot darrer un humà faci la feina “fina”, els retocs finals, per acabar tenint una “traducció automàtica corregida per un humà”. Aquesta ha estat la tònica general en els darrers trenta anys, i també ho és amb el traductor de Google: fa poc llegia un anunci d’una empresa de traduccions que deia que, amb el sistema de traducció de Google, “ajudat” per un traductor humà, tenim la millor combinació possible.

Google Translate, llançat el 2007, ha acostat a tothom la possibilitat de fer traduccions automàtiques de textos curts, normalment paràgrafs, perquè el sistema no deixa entrar textos llargs. Quina tecnologia fa servir? Tot i que l’empresa no ho diu, és una tecnologia més basada en estadística que en coneixement: en els darrers vint anys, la traducció automàtica ha anat migrant cap a mètodes estadístics, allunyant-se de les regles lingüístiques dels humans i aterrant en un camp més propi de la computació: calcular i sospesar alternatives (vegeu post anterior). En tot cas, el problema de Google, que permet als usuaris valorar la qualitat de la traducció i així anar millorant, és la privacitat, perquè el text que fem traduir es queda a les seves bases de dades.

De totes maneres, la pedra filosofal per a la traducció automàtica segueix sent el “coneixement del món” (o més aviat la manca d’aquest coneixement) que tenen les màquines. El fet que els ordinadors no sàpiguen com va el món i per tant difícilment interpretin el context de la traducció, és un gran punt feble. Qualsevol humà sap entendre en quin context es troba: formal a la feina, informal amb la família: tots sabem “com funciona” el món que ens envolta. Res d’això no saben els ordinadors, i per tant cauen en paranys ambigus que un nen de pocs anys ja sap veure. És per això que els costa entendre si un “banc”, en un text determinat, és un lloc que ens guarda els diners o bé un moble en un espai públic. Tot i que aquesta manca de coneixement del món se li pot proporcionar manualment a l’ordinador, aquest segueix sense saber les causalitats més bàsiques de la vida quotidiana i del món que ens envolta.

Direm per acabar aquest apartat que val el mateix avui que fa dècades: traduir a llengües semblants dona sempre millors resultats que fer-ho entre llengües “llunyanes”. Si teniu algun amic que parli una llengua molt diferent de la vostra, us podreu divertir amb el traductor de Google veient les errades, algunes d’elles ben divertides, com ara les que tenen a veure amb frases fetes. Un exemple clàssic és la traducció del fragment de l’evangeli de Marc “l’esperit és prest, però la carn és feble” que de l’anglès al rus va donar: “El vodka té bon gust, però la carn és podrida”.

HELLO, HELLO… QUE EM SENTS, ORDINADOR?

També als anys 60 van arribar els sistemes de síntesi de la parla (sistemes de text a veu) i de reconeixement de la parla (sistemes de veu a text), tot i que d’estris per a reproduir alguns sons humans n’hi havia ja a finals del segle XVIII. Algú pot dir que aquests processos son molt més mecànics, que generar un fonema qualsevol, per exemple una /t/ o bé una /a/ no ha de ser gaire difícil. I és cert. Però una cosa és l’inventari fonètic i l’altra l’ús concret dels fonemes en la parla. Per exemple, en català (i també en castellà i en hebreu, però no pas en italià ni en danès) tenim els fonemes aproximants: vegeu la diferència de la /d/ en pronunciar en català /doble/ o bé /cada/. Ja sabem que entre l’escriptura i la parla hi ha diferències de vegades molt grans, i una màquina que processi veu del o al català normatiu ha de conèixer la diferència entre una /o/ àtona (paraules com /fonema/, /oblit/,  /tortell/) que pronunciarà /u/ i la /o/ tònica, que pronunciarà com una /o/, per exemple: /fondre/, /ostra/, /rebost/. No cal dir que les màquines de text a veu ho tenen molt complicat amb llengües com l’anglès o el francès, l’escriptura de les quals difereix força de la seva pronunciació.

A banda de la qualitat dels fonemes i com aquests s’ “enganxen” per formar paraules, encara hi ha el tema de l’entonació. Els primers sintetitzadors de veu eren planers i soporífers en no canviar mai el to, mentre que, per als humans, aquest és un recurs que fem servir constantment tant de manera inconscient (totes les frases enunciatives les acabem amb una lleugera baixada de to) com volgudament per donar èmfasi a alguna paraula. Els sintetitzadors de veu van trigar molts anys a incorporar entonacions, i encara, segons com, aquestes ens semblen artificials.

Pel que fa al reconeixement de la parla i la seva aplicació a generar textos a partir de veu, els sistemes es troben amb els mateixos problemes fonètics que els sintetitzadors. Com parlem els humans? Doncs no gaire curosament, perquè elidim fonemes o acabaments de paraules, parlem en el nostre dialecte (que de vegades és molt lluny de la llengua estàndard, cas del xinès o el noruec), o parlem en ambients de molt soroll. I, malgrat tot això, ens entenem. Tot això, però, són obstacles infranquejables per a una màquina de reconeixement de veu. Proveu a fer servir algun software de conversió de veu a text i entreu-li un gravació amb molt de soroll, algun parlant amb accent estranger, etc. i veureu que ben aviat el sistema arriba als seus límits.

Què es recomana fer doncs amb els sistemes de veu a text o de text a veu? Doncs són eines útils… sempre que un humà es faci responsable del producte final i el revisi. Ah, guaita, igual com passa amb els sistemes de traducció automàtica!

FEM PETAR LA XERRADA AMB L’ORDINADOR?

Acabarem donant un cop d’ull als sistemes de diàleg persona-màquina, també anomenats sistemes conversacionals o “xatbots”, que són els que en aquestes darreres setmanes han fet titulars.

També als anys 60 es va començar a veure la possibilitat que els humans i els ordinadors “xerressin”, però ben aviat es va constatar que les màquines no eren bones conversadores. Per tal de fer-los-ho més fàcil, la interacció lingüística es va restringir a uns camps determinats, en els quals la màquina era capaç de simular una conversa limitada. El més famós d’aquests sistemes era un “psicòleg” anomenat Eliza que donava “suport” al seu interlocutor. Qui vulgui provar aquest sistema, en un viatge a l’arqueologia d’aquestes tecnologies, pot fer-ho en anglès o en castellà.

Tot i ser desenvolupat pels grans cervells americans de l’època, aquest sistema en realitat és senzillíssim perquè reconeix determinades paraules o estructures i hi reacciona segons uns patrons pre-establerts.

Cap als anys vuitanta van començar a sortir els “xatbots” amb una petita trampa: darrere hi havia un humà. Eren simplement una interfície nova de relació entre persones. Evidentment, la qualitat de la conversa va pujar força. Aquest sistema és una opció que s’ha mantingut fins als nostres dies: quan em connecto a la biblioteca de la meva universitat, apareix un petit “xatbot” a un racó de la pantalla dient que si vull ajuda em connectarà a un bibliotecari. Aquesta és la versió humana que es manté en certs entorns i és força útil.

Però l’excitació que creà Eliza no va deixar indiferents els científics i els tècnics: cap als anys 90 es desenvolupen els agents conversacionals virtuals (per exemple tots els sistemes que “conversen” amb nosaltres quan truquem a un número que rep trucades massives). A banda de reconèixer limitadament la veu (“pot repetir-me el seu nom si us plau?”) i respondre amb gravacions pre-establertes, aquests sistemes van obrir el camí per als “xatbots” actuals, els quals, treballant amb llengua escrita o parlada, tenen una certa eficàcia. Aquests són particularment útils a les companyies aèries, grans punts d’informació o altres organitzacions que treballen de cara al gran públic perquè estalvien cues d’espera. Ara bé, de seguida  que el sistema es veu ultrapassat, s’arronsa amb l’expressió “un moment si us plau, li passo un operador”, i és l´humà que ens resol un problema d’una certa complexitat o que necessiti una mica de sentit comú. Per a què serveixen doncs aquests “xatbots”? Es tracta de sistemes que bàsicament ofereixen informació a mida de l’usuari i així ajuden a descarregar els operadors humans. Perquè, diguem-ho ben clar, aquests sistemes no estan gens empoderats. No cal que els pregunteu “em pots fer un descompte?” o “puc entregar això un dia després?” perquè, de capacitat de decisió, res de res.

I arribem al plat fort, que és al bell mig de l’actualitat informativa de les darreres setmanes: els sistemes de xat  -compte amb l’afegit!- d’intel·ligència artificial. Aquestes dues parauletes ens deixen tan embadocats que semblen fetes per gent de màrqueting, no pas per enginyers. Ja vam veure en el darrer post que els ordinadors no són “intel·ligents” com nosaltres (però sí molt més eficients, com és el cas de moltes màquines – que justament per això les tenim!). Es tracta de sistemes conversacionals connectats a grans bases de dades d’informació i que, no només milloren en el nivell de conversa, sinó que són capaços de donar-nos informació de tota mena: des de les darreres tendències en sostenibilitat o dret penal fins a descriure fil per randa una operació de ronyó o dir-nos la millor manera fe der un suquet de peix. Gràcies a un nivell de processament de llenguatge i accés a informació millorats, pot dir-se que, quantitativament parlant, les màquines ens han superat. Cap humà no podrà ser alhora un gran jutge i un gran metge i un gran matemàtic. Els nous “xatbots”, sí. I anomenem només de passada alguns altres aspectes: producció de textos a gràfics, correcció de programari, etc.

D’ARA ENDAVANT

Què passarà d’ara endavant? Quant espai agafaran aquests nous sistemes? Els estudiants podran fer tots els treballs sense haver de pensar? I si és així, ens tornarem nosaltres menys intel·ligents havent cedit també la funció de “pensar” a les màquines? Fantàstics titulars, però toquem de peus a terra: si un professor sap que un estudiant seu escriu de manera barroera i desordenada, costarà creure que un treball polit i endreçat pugui ser d’aquella persona. Fa poc un col·lega de la redacció de Ciutat Nova comentava que ChatGPT repeteix força o parafraseja les preguntes que se li fan. Bona observació. També ho fa Eliza (vegeu més amunt) i és un recurs que sempre han tingut les màquines per guanyar credibilitat davant dels humans; de fet, és un recurs que fem sovint nosaltres mateixos en una conversa per assegurar a l’altre que seguim el fil i estem entenent els seus arguments.

Fa pocs dies llegia un blog en el qual una enginyera alemanya opinava que “ChatGPT és una meravella, però cal donar-li el toc final humà”. Estem per tant en la dialèctica de sempre amb aquestes màquines: elles poden fer la fina gruixuda (i en aquest cas en fan un bon tros), però nosaltres hem de fer la fina igualment. Res de nou doncs, però el que sí és nou és que s’ obre un nou camp professional per a tècnics que hauran de saber com “preguntar correctament” a sistemes com ChatGPT per tal d’obtenir la informació que busquen. Tal com diuen els experts, a aquests sistemes cal fer-los les preguntes adequades, altrament un biaix a l’inici de la ‘conversa’ pot fer que no se’ns doni la informació que cerquem o bé que no aprofitem del tot la base de coneixement de la màquina. És a dir, d’ara endavant no solament haurem de revisar el producte final que se’ns dona sinó que també haurem de saber entrar al sistema la nostra cerca de manera correcta. L’humà doncs estarà al darrer esglaó d’aquesta cadena i també al primer. Qui deia que les màquines ens escombrarien als humans?

Per qui necessiti encara més tranquil·litat, direm que la universitat de Princeton, als Estats Units, ja ha desenvolupat la primera app per a detectar la producció dels “xatbots” més avançats. No ens hauria d’estranyar que d’aquí a poc temps les eines de detecció de plagi siguin capaces de detectar el que fan els “xatbots”. Potser veurem una guerra tecnològica entre aquests nous sistemes i els programes que els volen detectar, com ja ha passat en altres àmbits, una persecució com el gos i el gat.

“Trigaré encara un parell de dies a enviar-te el post” [aquest que esteu llegint], li dic a l’amic que organitza el blog de Ciutat Nova. “Ah, això és perquè no fas servir cap d’aquests xats d’intel·ligència artificial”, em respon una mica foteta. Ric i quedo pensatiu alhora. Tinc clar que d’ara endavant tindrem millor accés a una informació massiva i ben preparada. I també tinc igualment clar que, a mig termini i amb una mica de pràctica, li sabrem veure el llautó a la màquina (com se li veu a Eliza, aquell primitiu “xatbot”) perquè, encara, nosaltres som força més eixerits que les màquines.


Aquí pots llegir l’article anterior del mateix autor: “Els ordinadors no entenen res, nosaltres sí”

Sobre l´autor

De l’Empordà als Andes: les bones rutes rarament són rectilínies. Pel camí, moltes trobades i ensenyaments – i els que vindran! Tot plegat m’ha portat al turisme, en el qual ensenyo i faig recerca.

0

Finalitzar Compra