Question 3
Consider the following code snippet:
from tokenizers import Tokenizerfrom tokenizers.models import BPEfrom tokenizers.trainers import BpeTrainerfrom tokenizers.normalizers import Lowercasefrom tokenizers.pre_tokenizers import Whitespacefrom tokenizers.processors import TemplateProcessing
data = ["hello", "world"]
# Create a tokenizer with BPE modelmodel = BPE()tokenizer = Tokenizer(model)
# Normalizer and Pre-tokenizertokenizer.normalizer = Lowercase()tokenizer.pre_tokenizer = Whitespace()
# Trainer for the tokenizertrainer = BpeTrainer(vocab_size=5000, special_tokens=["<s>", "</s>", "<pad>", "<unk>"])tokenizer.train_from_iterator(data, trainer)
# Post-processortokenizer.post_processor = TemplateProcessing(single="[CLS] $0 [SEP]", special_tokens=[("[CLS]", 2), ("[SEP]", 3)])
# Encode input and get the token IDsencoded = tokenizer.encode("Hello world")print("Token IDs:", encoded.ids)What will likely be printed as the output?
[2, 3]
[3, 0, 2]
[2, 0, 1, 3]
[3, 1, 0, 2]