Protein

View in Explore

Genbank accession

AGE61211.1 [GenBank]

Protein name

tail fiber protein and host specificity

RBP type

Evidence Phold

Probability 1,00

Evidence RBPdetect

Probability 0,53

Evidence RBPdetect2

Probability 0,95

Protein sequence

MLLTIHDANLKKVAFIDNDKQETLNYYDDTWTRSLETGSSTFEFTVYKKAIKSDTAINKTYNLLNERAFVSFRHNGKSYVFNVMTVEENEQTIKCYCENLNLELINEYANPYKATKAMSFVEYCNAMDLLNFTHLSVGINEISDQKRTLEWDGQDTKLARLLSLAKKFDAEIDFDTQLNADSSIKSFKVNVYHENDDKHQGVGRIRNDIQLTYGKNLKSIKRKIDKTGIYNAIRPTGKRRVKNSKGEEVEEIVTICSLDAWSENNADGVREFYQQGDFLYAPLSMQMYPSAFTSSTTNDQWIRKDMEVESDSPSVIRAAAIANLRKNAYPAITYEVDGFIDVEIGDTIKIYDNGFSPILLVQARVSDQKISFTNPNSNKTTFANFKTLENNLSDGIQAAFERLFEASKPYLIKLSTDNGVIFKNQIGQSIVTPTLYKGGKPVVAGVTWRWSLDGHTTTGMTYTVRGVDVTDTATLTIAAYIGNDEVAVDEISFVNVLDGTMGIPGTPGRDGRTPYVHTAWANNATGTSGFSLDSSINKLYIGIYTDFEPNDSTNPAKYKWTLIKGEKGEKGEKGDPGQRGLDGLQGEKGEQGIPGKNGADGRTQYTHLAYSNSADGSKDFSLSASDRSYIGMYVDFNSADSNRPSDYNWTLVKGSNGANGVAGKAGADGRTPYLHIAYSNIVLLANEFQNFNLSQTTLVRFGIEGSWVYKELSAGTYTANVATFGSDPARGKTKKVESISDFSVTDTVNKRYIGTYTDYTQEDSTDVSSYTWTLIKGDDGNGIANVTNYYLATTVSTGITKNSAGWTTTPQQISYTKRFLWNYRIELYTDGTTKTTDPTVIGVHGEKGDQGERGLQGLQGPKGDTGIQGPKGADGKSSYTHIAYATNSTGTQGFSTSDSTNKTYMGMYVDNIEADSTTPSKYHWTLIKGSDGAQGIPGAKGVDGRTPYLHIAYATNSTGTQGFSVTDSSGKTYIGQYTDFTQNDSTDPTKYKWSLIKGDKGDRGETGPQGPQGIQGIQGPKGDQGIAGAKGADGRTQYTHIAYADNATGGGFSQTDQTKAYIGMYQDFNVTDSTNPSSYRWSPWKGKDGKDGVPGPKGADGRTPYIHWAYSDSADGTGLTTSDNGQRYIGHYSDYTQADSTDKTKYRWADRWAKIEVGGQNLISGTASFSGTHWDKQGTWRLEESLYKRAGILTWVGGAKSSPIANISVQSGDTYTFSAYIKKENAGTVYFYLYDEHETWFAAANVPRETLIRDVGNNFQRFTITFKVTRSGILKPRFAIMASDTGGFSVAGYQLETGTLATDWSLAPEDIQAGIDSKADQVLTQERLNALNERAQILDAELKAKASMDALSDLEKAYQSFVKSHADSRAKAEADLAEAGRRIELLVTQFGGFKELKTFIDTYMSSSNEGLVIGKNDASSTIKVSSDRISMFSAGKEVMYISQGVIHIDNGIFTASVQIGRFRTEQYHLNVDMNVIRYVG

Physico‐chemical properties

protein length:	1480 AA
molecular weight:	162705,05120 Da
isoelectric point:	5,64510
aromaticity:	0,10541
hydropathy:	-0,56034

Domains

Domains [InterPro]

DC_0120
STR
1–591

DC_0120 DC_1328 G3DSA:1.20.5.320 DC_0921

IPR007119
Unmapped
64–382

IPR007119 IPR050149 Coil

IPR010572
ENZ
144–386

IPR010572 IPR008160 G3DSA:1.20.5.320 DC_1328

DC_1151
STR
578–802

DC_1151

AGE61211.1

1 1480

Architecture

STR

STR 1-1480

Legend: ATT STR RBD CBM LEC ENZ CHP LNK TAS TTP UNK Unmapped

Domains [InterPro]

Domain ID	Category	Cluster	Start	End	Layer	Name	Pref Zone	Confidence	Evidence	Support
DC_0120	STR	DC_0120	1	591	Novel HMM	DC_0120	Central	Low	Positional only	28 proteins / 28 hits
IPR007119	Unmapped	-	64	382	InterPro	Phage tail spike protein, N-terminal domain	-	-	-	-
IPR010572	ENZ	DC_0675	144	386	InterPro cluster	Tail spike domain	Central	High	Text match	419 proteins / 419 hits
IPR050149	Unmapped	-	499	1101	InterPro	Collagen superfamily	-	-	-	-
IPR008160	STR	DC_0536	565	601	InterPro cluster	Collagen triple helix repeat	C-terminal	High	Text match	355 proteins / 386 hits
DC_1151	STR	DC_1151	578	802	Novel HMM	DC_1151	Central	Low	Positional only	27 proteins / 27 hits
DC_1328	STR	DC_1328	774	930	Novel HMM	DC_1328	Central	Low	Positional only	136 proteins / 136 hits
G3DSA:1.20.5.320	STR	G3DSA:1.20.5.320	845	905	Merged direct domain	G3DSA:1.20.5.320	Central	Low	Positional only	67 proteins / 67 hits
DC_1328	STR	DC_1328	926	1089	Novel HMM	DC_1328	Central	Low	Positional only	136 proteins / 136 hits
G3DSA:1.20.5.320	STR	G3DSA:1.20.5.320	996	1051	Merged direct domain	G3DSA:1.20.5.320	Central	Low	Positional only	67 proteins / 67 hits
DC_0921	STR	DC_0921	1085	1480	Novel HMM	DC_0921	Central	Low	Positional only	77 proteins / 77 hits
Coil	Unmapped	-	1369	1389	Coils	Coil	-	-	-	-

Taxonomy

	Name	Taxonomy ID	Lineage
Phage	Streptococcus phage phiST1 [NCBI]	1277892	Viruses > Duplodnaviria > Heunggongvirae > Uroviricota > Caudoviricetes
Host	Streptococcus suis ST1 [NCBI]	1004951	Bacillota > Bacilli > Lactobacillales > Streptococcaceae > Streptococcus > Streptococcus suis

Coding sequence (CDS)

Genbank protein accession

AGE61211.1 [NCBI]

Genbank nucleotide accession

KC413988.1 [NCBI]

CDS location

range 3882 -> 8324
strand -

CDS

ATGCTATTAACAATTCATGATGCAAATCTAAAGAAAGTAGCATTTATTGATAACGATAAACAAGAAACTTTAAACTACTATGATGACACTTGGACACGCAGTCTAGAAACGGGGTCATCAACTTTTGAATTTACAGTATACAAGAAAGCTATAAAGTCTGATACAGCGATAAATAAAACATATAATTTACTGAATGAGCGTGCTTTTGTCTCATTTAGACACAACGGCAAAAGCTATGTATTTAATGTGATGACTGTTGAGGAAAATGAGCAAACTATCAAATGCTATTGCGAAAACCTGAACTTAGAGCTTATCAATGAGTATGCCAATCCGTACAAAGCTACTAAAGCTATGTCATTTGTTGAGTATTGTAATGCAATGGACTTGTTGAATTTCACTCACCTTTCTGTTGGTATCAATGAAATTTCAGACCAAAAACGGACTCTAGAATGGGATGGGCAGGATACCAAACTTGCCCGCTTACTAAGTCTTGCCAAAAAGTTTGATGCAGAGATTGATTTTGATACGCAGTTAAATGCTGATAGTTCCATCAAATCCTTTAAGGTAAATGTGTATCATGAAAACGACGATAAACATCAAGGGGTAGGGCGTATTAGGAACGATATTCAGCTTACCTATGGGAAAAATCTTAAATCTATCAAGCGTAAGATTGATAAAACGGGGATTTATAACGCTATCCGCCCAACTGGCAAAAGGAGAGTTAAAAATTCAAAAGGGGAAGAAGTTGAGGAGATTGTAACCATTTGCAGTCTGGATGCATGGTCAGAAAACAACGCTGATGGTGTTCGTGAGTTCTACCAGCAAGGAGACTTTCTCTATGCACCATTGTCAATGCAGATGTATCCATCCGCCTTTACCAGTTCCACAACCAATGACCAATGGATTAGGAAAGATATGGAGGTTGAAAGTGATAGTCCATCTGTTATTAGGGCAGCAGCTATTGCTAACCTTAGAAAAAACGCTTATCCAGCCATAACCTATGAAGTGGATGGTTTTATTGATGTAGAGATTGGCGACACCATCAAGATTTATGATAACGGTTTTAGCCCTATCTTGCTGGTGCAGGCTAGGGTGTCAGACCAGAAAATAAGTTTTACGAACCCCAATAGTAACAAAACTACTTTTGCTAATTTTAAAACTCTTGAAAATAACTTATCAGATGGTATTCAAGCTGCTTTTGAGCGTTTGTTTGAGGCATCTAAGCCCTACCTTATTAAGTTATCCACAGACAACGGCGTTATCTTTAAAAACCAAATTGGACAGAGCATTGTCACTCCTACCTTGTACAAGGGTGGTAAGCCTGTCGTTGCTGGTGTCACATGGCGTTGGTCCTTGGATGGTCATACAACAACAGGAATGACCTACACAGTTCGTGGGGTGGATGTGACAGACACGGCTACCTTGACTATCGCAGCCTATATTGGTAATGATGAGGTGGCAGTTGATGAGATTTCCTTTGTCAATGTCTTGGATGGCACCATGGGAATACCAGGAACACCGGGGCGAGACGGTCGAACTCCTTATGTGCATACAGCATGGGCAAATAATGCTACTGGTACATCCGGTTTCTCTTTGGATAGTTCGATTAATAAACTCTATATTGGTATCTATACGGATTTTGAGCCAAATGATAGCACTAACCCCGCTAAGTACAAATGGACTTTAATCAAGGGCGAAAAAGGCGAAAAGGGCGAAAAAGGCGACCCTGGACAGCGAGGGCTTGATGGTTTGCAGGGAGAAAAAGGTGAGCAGGGCATACCGGGTAAAAATGGGGCTGATGGTCGTACTCAATATACCCACCTAGCTTATTCTAATAGCGCAGATGGCTCTAAGGATTTCTCATTAAGTGCCTCTGACCGCTCTTATATCGGTATGTACGTTGATTTTAATAGTGCTGATAGCAATAGACCATCTGATTATAATTGGACACTTGTTAAAGGCTCGAATGGAGCAAATGGTGTTGCTGGTAAAGCTGGTGCAGATGGTAGGACACCATACTTGCACATAGCCTATTCAAATATCGTATTACTTGCTAATGAGTTTCAAAATTTCAATCTATCACAAACTACCTTGGTTCGTTTTGGAATAGAAGGTAGTTGGGTCTATAAAGAGTTGTCAGCAGGTACATATACTGCAAATGTGGCGACTTTTGGTAGTGACCCAGCCCGTGGAAAGACAAAGAAAGTTGAAAGTATTAGTGATTTTAGTGTAACAGATACTGTAAATAAGCGGTACATTGGAACATATACCGACTATACACAGGAAGATAGTACGGATGTTTCTAGCTATACATGGACATTGATTAAGGGTGATGATGGTAATGGTATTGCCAATGTTACTAACTACTATCTAGCTACCACAGTCTCAACAGGAATTACCAAAAACAGTGCTGGTTGGACAACGACACCTCAACAAATAAGCTACACTAAACGTTTTTTATGGAACTATCGCATTGAACTTTACACAGACGGCACTACGAAAACAACAGATCCAACAGTTATTGGCGTCCACGGTGAGAAAGGCGATCAAGGGGAACGTGGTTTACAAGGTTTGCAAGGACCAAAGGGAGATACTGGTATCCAAGGACCAAAAGGTGCAGATGGGAAATCAAGCTATACTCACATTGCCTATGCTACTAATTCGACAGGTACACAGGGATTTAGCACATCTGATAGCACAAACAAAACGTATATGGGTATGTATGTTGACAATATTGAGGCTGACAGCACTACACCATCTAAGTACCACTGGACCTTAATCAAAGGCTCTGACGGTGCTCAGGGCATACCTGGTGCCAAAGGAGTTGATGGGCGTACTCCATACTTACATATTGCCTATGCTACCAACTCAACAGGTACACAAGGATTTAGTGTGACTGATAGTAGTGGTAAAACCTATATTGGTCAATACACCGATTTTACGCAAAACGACAGCACAGACCCTACTAAGTATAAGTGGTCATTAATCAAAGGAGATAAAGGGGACCGGGGTGAAACTGGCCCGCAAGGTCCACAAGGAATACAAGGTATTCAGGGACCAAAGGGTGACCAGGGGATTGCTGGCGCTAAGGGCGCCGATGGACGTACCCAATACACTCACATTGCATATGCTGATAATGCAACTGGCGGAGGTTTTAGCCAAACAGACCAAACTAAAGCCTATATTGGCATGTACCAAGACTTTAACGTTACTGATAGCACCAATCCTAGCTCTTATCGTTGGTCTCCATGGAAAGGTAAGGATGGGAAAGATGGTGTTCCTGGACCTAAGGGGGCAGACGGTAGAACTCCATACATCCATTGGGCTTACTCGGATAGTGCGGACGGTACAGGCTTGACCACATCAGATAATGGTCAGCGATATATCGGGCATTACTCAGATTACACACAAGCTGATAGCACGGATAAGACAAAGTATCGCTGGGCAGATAGGTGGGCGAAGATTGAGGTGGGTGGACAAAATTTAATTTCAGGTACTGCATCTTTCTCTGGGACACACTGGGATAAGCAAGGGACGTGGCGACTAGAGGAGTCGCTTTATAAACGTGCTGGTATCCTGACTTGGGTTGGTGGCGCGAAATCGTCGCCGATAGCTAATATATCTGTACAATCAGGGGACACCTATACCTTTAGTGCCTATATCAAGAAAGAAAACGCAGGAACCGTTTATTTTTATCTGTATGATGAGCATGAAACATGGTTTGCGGCTGCAAATGTCCCTCGCGAGACTTTAATTCGAGATGTCGGGAACAACTTTCAGCGGTTTACAATCACTTTTAAAGTTACTCGGTCAGGTATATTAAAACCTCGATTTGCTATTATGGCTTCGGATACGGGCGGTTTTAGTGTAGCAGGCTACCAATTGGAAACTGGTACACTTGCGACAGACTGGTCGCTCGCTCCTGAAGATATACAAGCAGGCATTGACTCCAAAGCTGACCAAGTCCTAACTCAAGAACGGCTTAACGCTCTTAACGAGCGGGCACAGATACTTGATGCAGAGCTTAAAGCAAAGGCGTCTATGGATGCGCTTAGTGACCTCGAGAAAGCTTATCAATCATTTGTAAAATCACATGCTGATAGCCGAGCTAAAGCAGAAGCAGATTTGGCAGAGGCAGGCAGACGGATTGAGTTGCTGGTTACGCAGTTTGGCGGTTTTAAAGAGCTTAAAACATTTATTGATACTTATATGTCAAGCTCTAACGAGGGTTTGGTTATCGGCAAGAATGATGCAAGCTCAACCATTAAAGTGTCAAGCGATAGAATTTCCATGTTTTCGGCTGGTAAAGAAGTAATGTACATTTCGCAAGGTGTTATTCATATAGACAATGGTATCTTTACTGCCTCTGTACAGATTGGACGGTTCCGCACAGAACAATATCATCTCAATGTCGATATGAATGTCATACGGTATGTTGGGTAG

Genome Context

Tertiary structure

PDB ID

95f9543cf2c6c67aabe38531d9ca713df5482d05831482e9a1d7686b36fb5a76

ESMFold

Source ESMFold

Method ESMFold

Resolution 0,6857

Oligomeric State monomer

Download PDB

Model Confidence

Very high
pLDDT > 90

High
90 > pLDDT > 70

Low
70 > pLDDT > 50

Very low
pLDDT < 50

Protein

Domains

Domains [InterPro]

Domains [InterPro]

Taxonomy

Coding sequence (CDS)

Coding sequence (CDS)

Genome Context

Genome Context

Tertiary structure

Predicted Aligned Error (PAE)

Model Confidence