Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento

Puglia Laca, Juan Diego

Supervisor(es): Ferres Caceres, Ignacio

Resumen:

Las proteínas están formadas por cadenas de aminoácidos cuyas secuencias determinan sus propiedades físicas y funcionales, entre ellas la localización subcelular. Aunque existen técnicas experimentales precisas para identificar la ubicación de una proteína dentro de una célula procariota, estas resultan costosas y demandan mucho tiempo. Por ello, desde fines de la década de 1980 se han desarrollado métodos computacionales capaces de predecir dicha localización a partir de la secuencia aminoacídica. La aplicación de la tecnología Transformers al análisis de proteínas ha permitido crear modelos capaces de detectar patrones complejos en las secuencias y generar representaciones vectoriales (embeddings) útiles para predecir propiedades emergentes. En este estudio se evaluó la capacidad de dichos modelos para inferir la localización subcelular de proteínas bacterianas. Para ello, se entrenaron dos clasificadores —(Random Forest y Support Vector Machine (SVM)— utilizando embeddings obtenidos de los modelos ESM C 300m, ESM C 600m y Prost T5. Los resultados demostraron que los modelos de lenguaje de proteínas pueden extraer información relevante sobre la localización subcelular directamente a partir de la secuencia aminoacídica. Los clasificadores alcanzaron altos niveles de desempeño, evidenciando la eficacia de este enfoque. Finalmente, se desarrolló una interfaz gráfica de usuario en Python que permite predecir la localización subcelular de proteínas bacterianas a partir de secuencias en formato FASTA.

Detalles Bibliográficos
2025
PROYECTOS-BI
APRENDIZAJE AUTOMÁTICO
BIOINFORMÁTICA
MODELOS DE LENGUAJE
PROTEÍNAS
Español
Universidad ORT Uruguay
RAD
https://hdl.handle.net/20.500.11968/7754
http://hdl.handle.net/20.500.11968/7754
Acceso abierto
Acceso abierto
_version_ 1875293704147697664
author Puglia Laca, Juan Diego
author_facet Puglia Laca, Juan Diego
author_role author
bitstream.checksum.fl_str_mv 54a449fa79c421e6a224d7445c99fd87
754fe8c22fb30fce28ec458fdf4c1504
077db2759669c50c9c918e4edb327a7f
bitstream.checksumAlgorithm.fl_str_mv MD5
MD5
MD5
bitstream.url.fl_str_mv https://rad.ort.edu.uy/bitstreams/1baeb5bf-89aa-4d54-bd4c-7625864efe89/download
https://rad.ort.edu.uy/bitstreams/15d5b026-a2fc-4179-a4bf-99049177675a/download
https://rad.ort.edu.uy/bitstreams/908bf0c4-1139-4c52-8154-35a3bafce1b4/download
collection RAD
dc.contributor.tribunal.none.fl_str_mv Yovine, Sergio Fabián
Graña Alfonso, Martín
dc.creator.advisor.none.fl_str_mv Ferres Caceres, Ignacio
dc.creator.none.fl_str_mv Puglia Laca, Juan Diego
dc.date.accessioned.none.fl_str_mv 2025-11-13T19:49:39Z
dc.date.available.none.fl_str_mv 2025-11-13T19:49:39Z
dc.date.issued.none.fl_str_mv 2025
dc.description.abstract.none.fl_txt_mv Las proteínas están formadas por cadenas de aminoácidos cuyas secuencias determinan sus propiedades físicas y funcionales, entre ellas la localización subcelular. Aunque existen técnicas experimentales precisas para identificar la ubicación de una proteína dentro de una célula procariota, estas resultan costosas y demandan mucho tiempo. Por ello, desde fines de la década de 1980 se han desarrollado métodos computacionales capaces de predecir dicha localización a partir de la secuencia aminoacídica. La aplicación de la tecnología Transformers al análisis de proteínas ha permitido crear modelos capaces de detectar patrones complejos en las secuencias y generar representaciones vectoriales (embeddings) útiles para predecir propiedades emergentes. En este estudio se evaluó la capacidad de dichos modelos para inferir la localización subcelular de proteínas bacterianas. Para ello, se entrenaron dos clasificadores —(Random Forest y Support Vector Machine (SVM)— utilizando embeddings obtenidos de los modelos ESM C 300m, ESM C 600m y Prost T5. Los resultados demostraron que los modelos de lenguaje de proteínas pueden extraer información relevante sobre la localización subcelular directamente a partir de la secuencia aminoacídica. Los clasificadores alcanzaron altos niveles de desempeño, evidenciando la eficacia de este enfoque. Finalmente, se desarrolló una interfaz gráfica de usuario en Python que permite predecir la localización subcelular de proteínas bacterianas a partir de secuencias en formato FASTA.
dc.description.none.fl_txt_mv Incluye bibliografía y anexos.
dc.format.extent.none.fl_str_mv 35 p., tbls., grafs.
dc.format.mimetype.none.fl_str_mv PDF
dc.identifier.citation.none.fl_str_mv Puglia Laca, J. D. (2025). Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento (Proyecto). Universidad ORT Uruguay, Facultad de Ingeniería. Recuperado de https://rad.ort.edu.uy/handle/20.500.11968/7754
dc.identifier.uri.none.fl_str_mv https://hdl.handle.net/20.500.11968/7754
http://hdl.handle.net/20.500.11968/7754
dc.language.iso.none.fl_str_mv spa
dc.publisher.none.fl_str_mv Universidad ORT Uruguay
dc.relation.none.fl_str_mv https://sisbibliotecas.ort.edu.uy/bib/97532
dc.rights.license.none.fl_str_mv Acceso abierto
dc.rights.none.fl_str_mv info:eu-repo/semantics/openAccess
dc.source.none.fl_str_mv reponame:RAD
instname:Universidad ORT Uruguay
instacron:Universidad ORT
dc.subject.none.fl_str_mv PROYECTOS-BI
APRENDIZAJE AUTOMÁTICO
BIOINFORMÁTICA
MODELOS DE LENGUAJE
PROTEÍNAS
dc.title.none.fl_str_mv Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
dc.type.none.fl_str_mv Trabajo final de carrera
info:eu-repo/semantics/bachelorThesis
dc.type.version.none.fl_str_mv info:eu-repo/semantics/publishedVersion
description Incluye bibliografía y anexos.
eu_rights_str_mv openAccess
format bachelorThesis
id RAD_d6c91455ede5656d56fabefda9662ed3
identifier_str_mv Puglia Laca, J. D. (2025). Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento (Proyecto). Universidad ORT Uruguay, Facultad de Ingeniería. Recuperado de https://rad.ort.edu.uy/handle/20.500.11968/7754
instacron_str Universidad ORT
institution Universidad ORT
instname_str Universidad ORT Uruguay
language spa
network_acronym_str RAD
network_name_str RAD
oai_identifier_str oai:rad.ort.edu.uy:20.500.11968/7754
publishDate 2025
publisher.none.fl_str_mv Universidad ORT Uruguay
reponame_str RAD
repository.mail.fl_str_mv rodriguez_v@ort.edu.uy
repository.name.fl_str_mv RAD - Universidad ORT Uruguay
repository_id_str 3927
rights_invalid_str_mv Acceso abierto
spelling Yovine, Sergio FabiánGraña Alfonso, MartínPuglia Laca, Juan DiegoFerres Caceres, Ignacio2025-11-13T19:49:39Z2025-11-13T19:49:39Z2025Puglia Laca, J. D. (2025). Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento (Proyecto). Universidad ORT Uruguay, Facultad de Ingeniería. Recuperado de https://rad.ort.edu.uy/handle/20.500.11968/7754https://hdl.handle.net/20.500.11968/7754http://hdl.handle.net/20.500.11968/7754Incluye bibliografía y anexos.Las proteínas están formadas por cadenas de aminoácidos cuyas secuencias determinan sus propiedades físicas y funcionales, entre ellas la localización subcelular. Aunque existen técnicas experimentales precisas para identificar la ubicación de una proteína dentro de una célula procariota, estas resultan costosas y demandan mucho tiempo. Por ello, desde fines de la década de 1980 se han desarrollado métodos computacionales capaces de predecir dicha localización a partir de la secuencia aminoacídica. La aplicación de la tecnología Transformers al análisis de proteínas ha permitido crear modelos capaces de detectar patrones complejos en las secuencias y generar representaciones vectoriales (embeddings) útiles para predecir propiedades emergentes. En este estudio se evaluó la capacidad de dichos modelos para inferir la localización subcelular de proteínas bacterianas. Para ello, se entrenaron dos clasificadores —(Random Forest y Support Vector Machine (SVM)— utilizando embeddings obtenidos de los modelos ESM C 300m, ESM C 600m y Prost T5. Los resultados demostraron que los modelos de lenguaje de proteínas pueden extraer información relevante sobre la localización subcelular directamente a partir de la secuencia aminoacídica. Los clasificadores alcanzaron altos niveles de desempeño, evidenciando la eficacia de este enfoque. Finalmente, se desarrolló una interfaz gráfica de usuario en Python que permite predecir la localización subcelular de proteínas bacterianas a partir de secuencias en formato FASTA.35 p., tbls., grafs.PDFspaUniversidad ORT Uruguayinfo:eu-repo/semantics/openAccessAcceso abiertoPROYECTOS-BIAPRENDIZAJE AUTOMÁTICOBIOINFORMÁTICAMODELOS DE LENGUAJEPROTEÍNASDesarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamientoTrabajo final de carrerainfo:eu-repo/semantics/bachelorThesisinfo:eu-repo/semantics/publishedVersionhttps://sisbibliotecas.ort.edu.uy/bib/97532reponame:RADinstname:Universidad ORT Uruguayinstacron:Universidad ORTFacultad de IngenieríaCarrera universitariaLicenciado en BiotecnologíaProyectoProyecto (Carrera Universitaria). Universidad ORT Uruguay, Facultad de IngenieríaFI - Licenciatura en Biotecnología - BIORIGINALMaterial completo.pdfMaterial completo.pdfapplication/pdf1473640https://rad.ort.edu.uy/bitstreams/1baeb5bf-89aa-4d54-bd4c-7625864efe89/download54a449fa79c421e6a224d7445c99fd87MD51THUMBNAILMaterial completo.pdf.jpgWritten by FormatFilter org.dspace.app.mediafilter.PDFBoxThumbnail on 2025-11-14T06:01:34Z (GMT).Generated Thumbnailimage/jpeg2779https://rad.ort.edu.uy/bitstreams/15d5b026-a2fc-4179-a4bf-99049177675a/download754fe8c22fb30fce28ec458fdf4c1504MD52TEXTMaterial completo.pdf.txtWritten by FormatFilter org.dspace.app.mediafilter.TikaTextExtractionFilter on 2026-07-10T17:41:31Z (GMT).Extracted texttext/plain63235https://rad.ort.edu.uy/bitstreams/908bf0c4-1139-4c52-8154-35a3bafce1b4/download077db2759669c50c9c918e4edb327a7fMD5320.500.11968/77542026-07-10 14:41:31.179open.accessoai:rad.ort.edu.uy:20.500.11968/7754https://rad.ort.edu.uyhttps://rad.ort.edu.uy/Universidadhttps://www.ort.edu.uy/https://rad.ort.edu.uy/server/oai/requestrodriguez_v@ort.edu.uyUruguayopendoar:39272026-07-10T17:41:31RAD - Universidad ORT Uruguayfalse
spellingShingle Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
Puglia Laca, Juan Diego
PROYECTOS-BI
APRENDIZAJE AUTOMÁTICO
BIOINFORMÁTICA
MODELOS DE LENGUAJE
PROTEÍNAS
status_str publishedVersion
title Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
title_full Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
title_fullStr Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
title_full_unstemmed Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
title_short Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
title_sort Desarrollo de un clasificador de localización subcelular de proteínas utilizando representaciones vectoriales de secuencias proteicas derivadas de Modelos de Lenguaje como datos de entrenamiento
topic PROYECTOS-BI
APRENDIZAJE AUTOMÁTICO
BIOINFORMÁTICA
MODELOS DE LENGUAJE
PROTEÍNAS
url https://hdl.handle.net/20.500.11968/7754
http://hdl.handle.net/20.500.11968/7754