Apa itu Tokenization?
Sebelum model bahasa membaca prompt atau menghasilkan jawaban, teks diubah menjadi unit unit token. Token dapat berupa satu karakter, bagian kata, tanda baca, atau satu kata utuh. Cara pemecahannya bergantung pada tokenizer dan encoding yang dipakai model.
Kalimat yang terlihat pendek dapat memakai jumlah token berbeda pada model yang berbeda. Spasi, tanda baca, dan bagian kata ikut dihitung, sehingga jumlah kata tidak dapat dipakai sebagai hitungan token yang pasti.
Cara kerja sederhana
Tokenizer mengubah teks menjadi deretan token atau ID numerik. Model memproses deretan itu dan menghasilkan token berikutnya satu per satu. Token keluaran kemudian diubah kembali menjadi teks yang dibaca pengguna.
Kenapa Anda perlu memahaminya?
Jumlah token memengaruhi batas context window, waktu pemrosesan, dan biaya pada banyak API. Memahaminya membantu menulis prompt yang ringkas, membagi dokumen panjang, serta menghindari perkiraan keliru bahwa satu kata selalu sama dengan satu token.
Kesalahpahaman yang umum
Token adalah unit hasil pemecahan teks. Tokenization adalah proses pemecahannya. Token juga bukan selalu satu kata atau satu karakter, dan jumlah token untuk teks yang sama dapat berbeda antar model atau encoding.
Catatan penting sebelum menggunakannya
Patokan kasar jumlah karakter atau kata hanya akurat untuk kasus tertentu dan bahasa tertentu. Untuk batas atau biaya yang penting, gunakan tokenizer atau dokumentasi model yang benar, karena setiap model dapat memakai encoding berbeda.