Ответ на вопрос
Кратко, по пунктам.
1) Функции вставки "yaar" в примере "I told him, yaar, don't do this"
- Вокатив / обращение (vocative): близкий аналог «dude», «mate» — адресует высказывание собеседнику или подчёркивает обращённость.
- Дискурсный/прагматический маркер: выражает эмоцию (раздражение, досаду, сочувствие), смягчает или усиляет директиву.
- Индекс социально-культурной идентичности: сигнализирует принадлежность к англо-индийскому, хинди/урду-культурному контексту.
- Организация речи: паузовая вставка, маркер связности/фокусировки между репортажной частью и прямой речью.
2) Как её транскрибировать
- Орфографически: "yaar" (часто встречается в латинице).
- Деванагари: "यार".
- IPA (варианты, в зависимости от акцента): \(/jɑːr/\), \(/jaːɾ/\) или более нейтрально \(/jɑːɾ/\). (В индийском варианте /r/ часто реализуется как альвеолярный тап \(/ɾ/\).)
- Для ASR/фонетической лексики: дать несколько телефонных вариантов, напр.: \(/j aː r/\), \(/j aː ɾ/\) и краткую форму при быстрой речи.
3) Как учитывать в переводе
- Принцип: переводить функцию, а не обязательно форму. Возможности:
- Сохранить эквивалент-вокатив: "чувак", "дружище", "брат" — для неформального, товарищеского оттенка. Пример: "Я ему сказал, чувак, не делай этого."
- Передать прагматический смысл без прямого вокатива: "Я ему сказал, мол, не делай этого." или "Я ему сказал, да ладно, не делай этого." — если важнее эмоция/семантика, а не адресная форма.
- Опустить при невысокой переводческой важности, если мешает стилю целевого языка (но это теряет индекс идентичности).
- Выбор зависит от контекста и целевого регистра; в формальном тексте лучше переводить как прагматический маркер или опустить, в художественном — сохранить как вокатив с подбором адекватного сленга.
4) Как учитывать в обучении моделей (ASR / MT / NLP)
- Корпус и аннотация:
- Языковой тег: маркировать токен как [HI]yaar[/HI] или यार.
- Аннотировать функцию: VOC (vocative), PRAG (pragmatic marker), ID (identity) — для обучения функциональных классификаторов и MT-руководств.
- ASR:
- Включить в акустическую/лексическую базу варианты произношения; добавить фонетические транскрипции.
- Пометить как отдельный лексемный элемент (не разрезать субсловно при нормализации, если важно сохранить код-шифт).
- MT:
- Обучать на данных с сохранёнными тэгами/аннотациями, либо использовать специальных маркеров начала/конца вставки: yaar.
- Внимание: прямой буквальный перенос может быть нежелателен — лучше давать цельный целевой эквивалент (функция→фраза). Добавить в обучение пары с разными переводными опциями (сохранённый вокатив / прагматический перевод / опущенный).
- Токенизация/субсловный уровень:
- Оставлять целые токены для часто встречающихся вставок; добавить нормализацию транслитераций ("yaar", "yaar,", "yar") в preprocessing.
- Data augmentation:
- Генерировать синтетические код‑свитч примеры, обучать модель распознавать и переводить по функции.
- Оценка:
- Оценивать не только n‑gram метриками, но и прагматическую адекватность (ручные аннотации, human eval), поскольку BLEU плохо фиксирует сохранение функции вставки.
5) Короткие рекомендации переводчику/инженеру
- В переводе: сохранять функцию; выбирать эквивалент по регистру и эмоциональному тону; при сомнении оставить нейтральную прагматическую фразу.
- В корпусах: сохранять оригинал + тег языка + поясняющий глосс (например: yaa r [VOC: 'friend' / pragmatic exasperation]).
- В моделях: дать явные языковые/функциональные метки и фонетические варианты для ASR.
Примеры переводов на русский:
- Неофициально, дружески: "Я ему сказал, чувак, не делай этого."
- Нейтрально (передаёт смысл маркера): "Я ему сказал, мол — не делай этого."
- Сохранение идентичности: "Я ему сказал, яар, не делай этого." (оставить неизменным — редко уместно в русском тексте).
(Если нужно, могу дать набор аннотаций/форматов для корпуса и пример правил нормализации/лексикона.)
Еще