{"id":{"repo_id":"brazil-ufv","oai_identifier":"oai:locus.ufv.br:123456789/32255"},"canonical_url":"https://search.dev.ndltd.org/etd/brazil-ufv/oai:locus.ufv.br:123456789/32255","repository":{"repo_id":"brazil-ufv","name":"Brazil UFV","base_url":"https://locus.ufv.br/server/oai/request"},"display":{"title":"Classiﬁcação estrutural de proteínas por meio de aprendizado não supervisionado","abstract":"A bioinformática estrutural se dedica ao estudo das estruturas tridimensionais de proteínas e macromoléculas. Neste trabalho, o interesse está nas estruturas de pro- teínas. A disponibilização de novas sequências e estruturas proteicas em bases pú- blicas de dados tem ocorrido em um ritmo bastante acelerado, aumentando também a necessidade de métodos automáticos e eﬁcientes para a extração e compreensão desse grande volume de dados. Segundo Gao et al. [2018], a bioinformática é uma ciência de mineração e interpretação de dados biológicos. Para eles, o ﬂuxo con- tínuo e crescente desses dados, assim como a necessidade de abordar problemas biomédicos cada vez mais complexos, tem gerado oportunidades desaﬁadoras para pesquisadores de mineração de dados e aprendizagem de máquina. Diversas estraté- gias para classiﬁcação estrutural de proteínas têm sido propostas nos últimos anos, utilizando descritores baseados em sequência e estrutura. Nesta pesquisa, avaliou-se a possibilidade de classiﬁcação estrutural de proteínas utilizando métodos não su- pervisionados associados a características propostas com sucesso em um classiﬁcador estrutural bem estabelecido. Foram realizados experimentos utilizando 5 algoritmos de agrupamento de 4 diferentes paradigmas. A qualidade dos grupos foi avaliada por meio do Coeﬁciente de Silhueta e os rótulos previstos foram comparados às classes e superfamílias da base CATH, por meio do índice Fowlkes Mallows e da veriﬁcação de homogeneidade e completude dos grupos. Os resultados mostram a inviabilidade de classiﬁcação no nível classe, já que os índices alcançados com Fowlkes Mollows não chegaram a 60%. Por outro lado, eles indicam uma capacidade considerável de classiﬁcação no nível superfamília - foi alcançado com o método Complete-Link um índice superior a 70% no agrupamento geral. Os resultados são ainda mais inte- ressantes quando restringe-se o número de grupos, alcançando um índice de 78.5% para topologias com até 25 superfamílias e de 82.8% para topologias com até 5 su- perfamílias. Se considerados ainda, agrupamentos com índice igual ou superior a 85%, eles representam aproximadamente 40% das topologias utilizadas, sendo que deste grupo, quase metade dos agrupamentos (48.19%) obteve um índice de 100% de similaridade, ou seja, em cerca de 20% das topologias, todas as proteínas foram agrupadas corretamente.","abstract_html":"A bioinformática estrutural se dedica ao estudo das estruturas tridimensionais de proteínas e macromoléculas. Neste trabalho, o interesse está nas estruturas de pro- teínas. A disponibilização de novas sequências e estruturas proteicas em bases pú- blicas de dados tem ocorrido em um ritmo bastante acelerado, aumentando também a necessidade de métodos automáticos e eﬁcientes para a extração e compreensão desse grande volume de dados. Segundo Gao et al. [2018], a bioinformática é uma ciência de mineração e interpretação de dados biológicos. Para eles, o ﬂuxo con- tínuo e crescente desses dados, assim como a necessidade de abordar problemas biomédicos cada vez mais complexos, tem gerado oportunidades desaﬁadoras para pesquisadores de mineração de dados e aprendizagem de máquina. Diversas estraté- gias para classiﬁcação estrutural de proteínas têm sido propostas nos últimos anos, utilizando descritores baseados em sequência e estrutura. Nesta pesquisa, avaliou-se a possibilidade de classiﬁcação estrutural de proteínas utilizando métodos não su- pervisionados associados a características propostas com sucesso em um classiﬁcador estrutural bem estabelecido. Foram realizados experimentos utilizando 5 algoritmos de agrupamento de 4 diferentes paradigmas. A qualidade dos grupos foi avaliada por meio do Coeﬁciente de Silhueta e os rótulos previstos foram comparados às classes e superfamílias da base CATH, por meio do índice Fowlkes Mallows e da veriﬁcação de homogeneidade e completude dos grupos. Os resultados mostram a inviabilidade de classiﬁcação no nível classe, já que os índices alcançados com Fowlkes Mollows não chegaram a 60%. Por outro lado, eles indicam uma capacidade considerável de classiﬁcação no nível superfamília - foi alcançado com o método Complete-Link um índice superior a 70% no agrupamento geral. Os resultados são ainda mais inte- ressantes quando restringe-se o número de grupos, alcançando um índice de 78.5% para topologias com até 25 superfamílias e de 82.8% para topologias com até 5 su- perfamílias. Se considerados ainda, agrupamentos com índice igual ou superior a 85%, eles representam aproximadamente 40% das topologias utilizadas, sendo que deste grupo, quase metade dos agrupamentos (48.19%) obteve um índice de 100% de similaridade, ou seja, em cerca de 20% das topologias, todas as proteínas foram agrupadas corretamente.","abstract_has_math":false,"creators":["Monteiro, Cleiton Rodrigues"],"institution":"Universidade Federal de Viçosa","degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":["Comarela, Giovanni Ventorim"],"advisors":["Silveira, Sabrina de Azevedo"],"committee_chairs":[],"committee_members":[],"year":2019,"date_issued":"2019-06-25","date_published":"2019-06-25","updated_at":"2026-07-24T01:21:00Z","subjects":["Bioinformática","Proteínas - Estrutura","Análise por agrupamento"],"languages":["por"],"rights":["Acesso Aberto"],"rights_urls":[],"identifier_entries":[]},"links":{"outbound_url":"https://locus.ufv.br//handle/123456789/32255","outbound_label":"Repository record","outbound_source":"dc:identifier.uri"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor","label":"Contributor","values":["Comarela, Giovanni Ventorim"]},{"key":"dc:contributor.advisor","label":"Advisor","values":["Silveira, Sabrina de Azevedo"]},{"key":"dc:creator","label":"Author","values":["Monteiro, Cleiton Rodrigues"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date.accessioned","label":"Dc Date Accessioned","values":["2024-03-08T15:54:47Z"]},{"key":"dc:date.available","label":"Dc Date Available","values":["2024-03-08T15:54:47Z"]},{"key":"dc:date.issued","label":"Date","values":["2019-06-25"]},{"key":"dc:publisher","label":"Institution","values":["Universidade Federal de Viçosa"]},{"key":"dc:type","label":"Dc Type","values":["Dissertação"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Bioinformática","Proteínas - Estrutura","Análise por agrupamento"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language.iso","label":"Language (ISO)","values":["por"]},{"key":"dc:rights","label":"Dc Rights","values":["Acesso Aberto"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier.uri","label":"Identifier URI","values":["https://locus.ufv.br//handle/123456789/32255"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description.abstract","label":"Abstract","values":["A bioinformática estrutural se dedica ao estudo das estruturas tridimensionais de proteínas e macromoléculas. Neste trabalho, o interesse está nas estruturas de pro- teínas. A disponibilização de novas sequências e estruturas proteicas em bases pú- blicas de dados tem ocorrido em um ritmo bastante acelerado, aumentando também a necessidade de métodos automáticos e eﬁcientes para a extração e compreensão desse grande volume de dados. Segundo Gao et al. [2018], a bioinformática é uma ciência de mineração e interpretação de dados biológicos. Para eles, o ﬂuxo con- tínuo e crescente desses dados, assim como a necessidade de abordar problemas biomédicos cada vez mais complexos, tem gerado oportunidades desaﬁadoras para pesquisadores de mineração de dados e aprendizagem de máquina. Diversas estraté- gias para classiﬁcação estrutural de proteínas têm sido propostas nos últimos anos, utilizando descritores baseados em sequência e estrutura. Nesta pesquisa, avaliou-se a possibilidade de classiﬁcação estrutural de proteínas utilizando métodos não su- pervisionados associados a características propostas com sucesso em um classiﬁcador estrutural bem estabelecido. Foram realizados experimentos utilizando 5 algoritmos de agrupamento de 4 diferentes paradigmas. A qualidade dos grupos foi avaliada por meio do Coeﬁciente de Silhueta e os rótulos previstos foram comparados às classes e superfamílias da base CATH, por meio do índice Fowlkes Mallows e da veriﬁcação de homogeneidade e completude dos grupos. Os resultados mostram a inviabilidade de classiﬁcação no nível classe, já que os índices alcançados com Fowlkes Mollows não chegaram a 60%. Por outro lado, eles indicam uma capacidade considerável de classiﬁcação no nível superfamília - foi alcançado com o método Complete-Link um índice superior a 70% no agrupamento geral. Os resultados são ainda mais inte- ressantes quando restringe-se o número de grupos, alcançando um índice de 78.5% para topologias com até 25 superfamílias e de 82.8% para topologias com até 5 su- perfamílias. Se considerados ainda, agrupamentos com índice igual ou superior a 85%, eles representam aproximadamente 40% das topologias utilizadas, sendo que deste grupo, quase metade dos agrupamentos (48.19%) obteve um índice de 100% de similaridade, ou seja, em cerca de 20% das topologias, todas as proteínas foram agrupadas corretamente.","Structural bioinformatics is dedicated to the study of three-dimensional structures of proteins and macromolecules. In this work, the interest is in protein structures. The availability of new sequences and protein structures in public databases has been occurring at a very fast pace, also increasing the need for automatic and eﬃci- ent methods for extracting and understanding this large volume of data. According to Gao et al. [2018], bioinformatics is a science of mining and interpreting biological data. For them, the continuous and increasing ﬂow of this data, as well as the need to address increasingly complex biomedical problems, has created challenging op- portunities for data mining and machine learning researchers. Several strategies for structural protein classiﬁcation have been proposed in recent years using sequence and structure based descriptors. In this research, evaluated the possibility of struc- tural protein classiﬁcation using unsupervised methods associated with successfully proposed characteristics in a well established structural classiﬁer. Experiments were performed using 5 clustering algorithms from 4 diﬀerent paradigms. The quality of the clusters was evaluated by the Silhouette Coeﬃcient and the predicted labels were compared to the CATH database superfamily classiﬁcations using the Fowl- kes Mallows Index and the veriﬁcation of clusters homogeneity and completeness. The results show the unfeasibility of class level classiﬁcation, since the rates achie- ved with Fowlkes Mollows did not reach 60%. On the other hand, they indicate a considerable ability to classify at the superfamily level - an Index of over 70% was achieved with the Complete-Link method in the general clustering. The results are even more interesting when restricting the number of clusters, reaching an index of 78.5% for topologies with up to 25 superfamilies and 82.8% for topologies with up to 5 superfamilies. If still considered, clusters with an index equal to or greater than 85%, they represent approximately 40% of the topologies used, and of this group, almost half of the clusterings (48.19%) obtained a 100% similarity index, that is, in about 20% of the topologies, all proteins were clustered correctly."]},{"key":"dc:title","label":"Title","values":["Classiﬁcação estrutural de proteínas por meio de aprendizado não supervisionado","Protein structural classiﬁcation through unsupervised learning"]}]}],"canonical_facts":{"dc:contributor":["Comarela, Giovanni Ventorim"],"dc:contributor.advisor":["Silveira, Sabrina de Azevedo"],"dc:creator":["Monteiro, Cleiton Rodrigues"],"dc:date.accessioned":["2024-03-08T15:54:47Z"],"dc:date.available":["2024-03-08T15:54:47Z"],"dc:date.issued":["2019-06-25"],"dc:description.abstract":["A bioinformática estrutural se dedica ao estudo das estruturas tridimensionais de proteínas e macromoléculas. Neste trabalho, o interesse está nas estruturas de pro- teínas. A disponibilização de novas sequências e estruturas proteicas em bases pú- blicas de dados tem ocorrido em um ritmo bastante acelerado, aumentando também a necessidade de métodos automáticos e eﬁcientes para a extração e compreensão desse grande volume de dados. Segundo Gao et al. [2018], a bioinformática é uma ciência de mineração e interpretação de dados biológicos. Para eles, o ﬂuxo con- tínuo e crescente desses dados, assim como a necessidade de abordar problemas biomédicos cada vez mais complexos, tem gerado oportunidades desaﬁadoras para pesquisadores de mineração de dados e aprendizagem de máquina. Diversas estraté- gias para classiﬁcação estrutural de proteínas têm sido propostas nos últimos anos, utilizando descritores baseados em sequência e estrutura. Nesta pesquisa, avaliou-se a possibilidade de classiﬁcação estrutural de proteínas utilizando métodos não su- pervisionados associados a características propostas com sucesso em um classiﬁcador estrutural bem estabelecido. Foram realizados experimentos utilizando 5 algoritmos de agrupamento de 4 diferentes paradigmas. A qualidade dos grupos foi avaliada por meio do Coeﬁciente de Silhueta e os rótulos previstos foram comparados às classes e superfamílias da base CATH, por meio do índice Fowlkes Mallows e da veriﬁcação de homogeneidade e completude dos grupos. Os resultados mostram a inviabilidade de classiﬁcação no nível classe, já que os índices alcançados com Fowlkes Mollows não chegaram a 60%. Por outro lado, eles indicam uma capacidade considerável de classiﬁcação no nível superfamília - foi alcançado com o método Complete-Link um índice superior a 70% no agrupamento geral. Os resultados são ainda mais inte- ressantes quando restringe-se o número de grupos, alcançando um índice de 78.5% para topologias com até 25 superfamílias e de 82.8% para topologias com até 5 su- perfamílias. Se considerados ainda, agrupamentos com índice igual ou superior a 85%, eles representam aproximadamente 40% das topologias utilizadas, sendo que deste grupo, quase metade dos agrupamentos (48.19%) obteve um índice de 100% de similaridade, ou seja, em cerca de 20% das topologias, todas as proteínas foram agrupadas corretamente.","Structural bioinformatics is dedicated to the study of three-dimensional structures of proteins and macromolecules. In this work, the interest is in protein structures. The availability of new sequences and protein structures in public databases has been occurring at a very fast pace, also increasing the need for automatic and eﬃci- ent methods for extracting and understanding this large volume of data. According to Gao et al. [2018], bioinformatics is a science of mining and interpreting biological data. For them, the continuous and increasing ﬂow of this data, as well as the need to address increasingly complex biomedical problems, has created challenging op- portunities for data mining and machine learning researchers. Several strategies for structural protein classiﬁcation have been proposed in recent years using sequence and structure based descriptors. In this research, evaluated the possibility of struc- tural protein classiﬁcation using unsupervised methods associated with successfully proposed characteristics in a well established structural classiﬁer. Experiments were performed using 5 clustering algorithms from 4 diﬀerent paradigms. The quality of the clusters was evaluated by the Silhouette Coeﬃcient and the predicted labels were compared to the CATH database superfamily classiﬁcations using the Fowl- kes Mallows Index and the veriﬁcation of clusters homogeneity and completeness. The results show the unfeasibility of class level classiﬁcation, since the rates achie- ved with Fowlkes Mollows did not reach 60%. On the other hand, they indicate a considerable ability to classify at the superfamily level - an Index of over 70% was achieved with the Complete-Link method in the general clustering. The results are even more interesting when restricting the number of clusters, reaching an index of 78.5% for topologies with up to 25 superfamilies and 82.8% for topologies with up to 5 superfamilies. If still considered, clusters with an index equal to or greater than 85%, they represent approximately 40% of the topologies used, and of this group, almost half of the clusterings (48.19%) obtained a 100% similarity index, that is, in about 20% of the topologies, all proteins were clustered correctly."],"dc:identifier.uri":["https://locus.ufv.br//handle/123456789/32255"],"dc:language.iso":["por"],"dc:publisher":["Universidade Federal de Viçosa"],"dc:rights":["Acesso Aberto"],"dc:subject":["Bioinformática","Proteínas - Estrutura","Análise por agrupamento"],"dc:title":["Classiﬁcação estrutural de proteínas por meio de aprendizado não supervisionado","Protein structural classiﬁcation through unsupervised learning"],"dc:type":["Dissertação"]},"updated_at":"2026-07-24T01:21:00Z"}