Почему мы убрали Kafka из горячего пути
Разбор того, как перенос checkpoint-журнала из брокера в локальный WAL-хранилище снизил P99 латентность с 48ms до 12ms на кластере из 240 узлов.
/ блог · 142 публикации · обновлено 12.06.2025
Блог SyncOps
Технические разборы, производственные кейсы и честные отзывы. Пишем о том, что ломается в проде и как это чинить — без маркетинговой воды.
Поиск
Популярные запросы: checkpoint · WAL-журнал · kafka → s3 · конфликт-резолвинг
Свежее
Три самых новых материала. Каждый прошёл через внутренний код-ревью и проверку на реальном проде.
Разбор того, как перенос checkpoint-журнала из брокера в локальный WAL-хранилище снизил P99 латентность с 48ms до 12ms на кластере из 240 узлов.
Как проектировать идемпотентное применение на стороне цели, чтобы exactly-once не превращалось в «надеемся, что не задублится». С примерами мерджеров.
История миграции платёжного ядра на SyncOps: 4.2M msg/s, ноль потерянных транзакций и что пошло не так на третьей неделе.
Разделы
Плоская модель пайплайнов, WAL-журнал, vector clocks и то, почему мы против «магических» репликаторов. 38 статей.
Чек-листы, конфиги и паттерны: от алертинга на lag до корректного масштабирования. 52 статьи.
Кейсы клиентов с цифрами: throughput, uptime и что они сделали иначе. 52 истории.
Топ июня
По числу прочтений за 30 дней. Спойлер: про конфликты и про checkpoint снова в топе.
Когда логическая версия достаточно, а когда без vector clocks не обойтись. Разбираем на трёх реальных пайплайнах.
Почему по lag можно решить, что всё отлично, пока checkpoint не уехал на 40 секунд назад. Как настроить алерт.
Разбор инцидента при миграции части узлов в on-prem: рассинхрон реплик и как это ловить до пользователя.
Рассылка · раз в две недели
Отбираем один технический разбор и один кейс из прода. Пишем только о том, что реально поможет в проде — без «10 инструментов для данных».