Входит в LinguistPro
Reading Room
Двуязычная библиотека — канон иврита с морфологией по тапу.
Целая библиотека, а не пара отрывков
Если редактор LinguistPro — это «принеси любой текст», то Reading Room — «читай канон». Он превращает весь корпус иврита из общественного достояния в двуязычную, направляемую библиотеку чтения, где анализируемо каждое слово — на основе открытой работы проекта Бен-Иегуда (ивритский аналог проекта «Гутенберг»), чей открытый корпус мы каталогизируем, переводим и обогащаем. Он поставляется внутри LinguistPro и разделяет его privacy-first движок, но это самостоятельная учебная поверхность со своим способом входа.
Замысел
Каталогизировано 26 455 произведений, организованных так, как мыслят об ивритской литературе исследователи: разбивка Период → Автор → Произведение (в паритете с benyehuda.org). Можно двигаться от Библейского слоя через Средневековье (Золотой век Сфарада), Хаскалу, Тхию (возрождение иврита как живого языка), эпоху британского Мандата и Современный канон — поэзия, проза, статьи, мемуары, письма, басни и драма.
Смысл не только в доступе — это градуированный путь. Полка «С чего начать» поднимает короткие тексты, собранные из высокочастотной лексики, — лёгкий вход; персональный движок «следующий для тебя» рекомендует следующий текст чуть выше текущего уровня (принцип i+1 из теории усвоения второго языка), вычисляя всё на устройстве по вашей собственной лексике. Так учащийся может начать с стихотворения в несколько строк и, текст за текстом, дойти до чтения канона в оригинале — с переводом, никудом и полной морфологией всегда в одном тапе.
Честно, served-on-open
796 произведений готовы к чтению уже сегодня: машинно переведены через Gemini и озвучены никудом Dicta, с провенансом на каждой карточке — каждая помечена «машинный перевод» и «озвучки пока нет», и никогда не выдаётся за выверенный вручную канон. Остальная часть корпуса честно помечена «перевод позже» и со временем переходит в «готово» по мере перевода и морфологического обогащения.
Технически это верно privacy-first дизайну LinguistPro. Библиотека каталог-ориентирована и served-on-open: тонкий индекс кешируется заранее, а произведение материализуется в локальное хранилище браузера только при открытии — поэтому корпус из 26 000 работ не нагружает устройство, и ничто из прочитанного его не покидает. Тапните по любому слову для офлайн-морфологии; включите точный «контекстный режим» (Dicta), когда нужна дизамбигуация в конкретном предложении.
Построено на Google Cloud
Gemini переводит корпус на русский (и не только), а Cloud Translation v3 стоит за конвейером нейроперевода — те тяжёлые вычисления, что делают двуязычную библиотеку из 26 тысяч работ возможной для команды-одиночки.
Что дальше: от литературного канона к рабочему
Планируется / на дорожной карте — ещё не выпущено
Reading Room — это одна и та же машина, наведённая на фиксированный канон: ивритскую литературу из общественного достояния проекта Бен-Иегуда. Мы хотим навести тот же конвейер на канон другого рода — на практическое, техническое знание, которое нужно новоприбывшему, чтобы получить квалификацию рабочей специальности в Израиле. Этот планируемый трек мы называем Reading Room — Профессии.
Потребность вполне конкретна. Русскоязычные олим (новые репатрианты), осваивающие технические и производственные профессии, сталкиваются с двойным барьером — нужно одновременно учить и саму профессию, и иврит, на котором её преподают. Для этой аудитории появляется всё больше курсов профессионального обучения, в том числе практические инженерно-механические и производственные направления. Reading Room — Профессии дал бы таким учащимся двуязычные иврит–русские учебные пособия — задачники с разобранными решениями — чтобы можно было изучать материал сразу на двух языках, с терминологией, никудом, аудио и морфологией, которые движок LinguistPro уже предоставляет. Мы делали бы это как учебные пособия для учащихся, а не как официальные материалы какой-либо программы, и не заявляем ни о какой аффилиации, поддержке или аккредитации.
Первый задуманный корпус — иврит–русский «Материаловедение — задачник с разобранными решениями». У основателя инженерно-механическое образование и степень магистра, поэтому технические исходные тексты и решения лично курировались и вычитывались бы человеком, квалифицированным в этой области, прежде чем конвейер вообще их переведёт и озвучит — та же честная дисциплина, что и во всём Reading Room, где машинный результат помечается как машинный и никогда не выдаётся за выверенный вручную. Дальше последовали бы другие профессиональные и производственно-инженерные предметы, в порядке приоритета по тем курсам, на которые учащиеся реально записываются. Ни одного из этих корпусов пока не существует; это направление дорожной карты, и оно так и подаётся.
Здесь же, честно говоря, ключевую роль играет Google Cloud. Сегодня runtime-AI в LinguistPro работает под собственным ключом Google Cloud каждого пользователя в браузере — это оплачивает чтение, но не студийную работу по генерации нового предметного корпуса. Собрать такой корпус — это разовая пакетная задача на нашем собственном биллинг-аккаунте: перевести, объяснить, озвучить с никудом и синтезировать аудио для целого задачника ещё до того, как его откроет первый учащийся. Это ровно те тяжёлые вычисления — перевод и объяснение через Gemini и нейроперевод Cloud Translation v3, — которые мы уже выполняем в продакшене для литературного корпуса; плюс никуд-озвучка через Cloud Text-to-Speech, которую движок LinguistPro уже выполняет в продакшене; а Vertex AI — запланированный следующий шаг для дообученных моделей иврита, а не то, что работает в продакшене сегодня. Для основателя-одиночки без финансирования ограничение — не конвейер, а стоимость вычислений на передовых моделях в масштабе многих предметов. Именно эту нагрузку кредиты Google for Startups перенесли бы на собственный аккаунт Kolosei — превратив дорожную карту в выпущенные учебные пособия.