OPERATING DOCUMENT / BELUGA

Troubleshooting Guide

Root-cause analysis for Kafka lag, Flink checkpoint timeouts, and Trino OOMs.

01 / Context02 / Procedure03 / Operations04 / Verification

Troubleshooting Guide

Common operational failure modes and remediation runbooks for Beluga.

1. High Kafka Consumer Lag

  • Cause: Flink operator bottleneck or partition skew
  • Remediation: Scale Flink task parallelism and increase topic partition counts

2. Flink Checkpoint Timeouts

  • Cause: MinIO storage I/O contention or large RocksDB state payloads
  • Remediation: Verify incremental checkpointing is enabled; audit MinIO disk latency

3. Trino Query Memory Exhaustion

  • Remediation: Tune query.max-memory-per-node and enforce partition pruning in SQL queries
DOCUMENT TRACE

Return to the project record to see architecture, development pulse, proof and related field notes in one context.