Portal AI Indonesia
Kembali ke Glossary
GLOSSARY AILLM

Tokenization

Tokenization adalah proses memecah teks menjadi token agar dapat diproses oleh model AI.

DEFINISI

Apa itu Tokenization?

Sebelum model bahasa membaca prompt atau menghasilkan jawaban, teks diubah menjadi unit unit token. Token dapat berupa satu karakter, bagian kata, tanda baca, atau satu kata utuh. Cara pemecahannya bergantung pada tokenizer dan encoding yang dipakai model.

CONTOH SEDERHANA

Kalimat yang terlihat pendek dapat memakai jumlah token berbeda pada model yang berbeda. Spasi, tanda baca, dan bagian kata ikut dihitung, sehingga jumlah kata tidak dapat dipakai sebagai hitungan token yang pasti.

CARA KERJA SEDERHANA

Cara kerja sederhana

Tokenizer mengubah teks menjadi deretan token atau ID numerik. Model memproses deretan itu dan menghasilkan token berikutnya satu per satu. Token keluaran kemudian diubah kembali menjadi teks yang dibaca pengguna.

KENAPA PENTING

Kenapa Anda perlu memahaminya?

Jumlah token memengaruhi batas context window, waktu pemrosesan, dan biaya pada banyak API. Memahaminya membantu menulis prompt yang ringkas, membagi dokumen panjang, serta menghindari perkiraan keliru bahwa satu kata selalu sama dengan satu token.

JANGAN TERTUKAR

Kesalahpahaman yang umum

Token adalah unit hasil pemecahan teks. Tokenization adalah proses pemecahannya. Token juga bukan selalu satu kata atau satu karakter, dan jumlah token untuk teks yang sama dapat berbeda antar model atau encoding.

BATASAN YANG PERLU DIKETAHUI

Catatan penting sebelum menggunakannya

Patokan kasar jumlah karakter atau kata hanya akurat untuk kasus tertentu dan bahasa tertentu. Untuk batas atau biaya yang penting, gunakan tokenizer atau dokumentasi model yang benar, karena setiap model dapat memakai encoding berbeda.

LANJUT BELAJAR

Istilah terkait