Posts
Browse all articles.
-
Data This Week #23
5 min readApache OSSIE enters ASF incubation to standardize semantic layers, HubSpot scales to 20B vectors with Qdrant, cloud-native financial search with Iceberg and Turbopuffer, Lakekeeper's Generic Table API for multi-format lakehouses, and versioning Power BI with Git.
-
Data This Week #22
5 min readAWS S3 Annotations for business context, Cloudflare's Town Lake lakehouse and Skipper AI agent, Databricks LTAP rethinking database storage, Iceberg native views in Hive, Snowflake pipeline scaling pitfalls, and CRED's zero-data-loss RDS Blue/Green deployments at scale.
-
Data This Week #21
4 min readPostgres 19 pg_plan_advice for query plan control, Flink's Hadoop-free native S3 filesystem, incremental model pitfalls in dbt, Trino's summer SQL standard upgrades, PgBouncer's pooling mechanics, Razorpay's CDP architecture, and pgEdge ColdFront for Iceberg tiering.
-
Data This Week #20
5 min readKafka's nine-layer architecture breakdown, self-healing pipeline barriers, ClickHouse full-text search on object storage, Google Cloud Next '26 data infrastructure, watsonx.data semantic layer, Neo4j on Databricks, DuckDB internals, and handling messy Excel ETL.
-
Data This Week #19
5 min readSlack's SSH-to-REST EMR migration, clusterless Iceberg Lakehouse with DuckDB, Iceberg v4 metadata proposals, Spark 4.0 on EMR GA, Apache Gravitino unified catalog, and Databricks Omnigent for AI agent orchestration.
-
Data This Week #18
4 min readSupabase Multigres for Postgres scaling, Netflix's dynamic Cassandra partition splitting, dbt Core v2 on Rust, SQL/PGQ graph queries in Postgres 19, and IAM fundamentals for data engineers.
-
Data This Week #17
4 min readPulsar 5.0 Scalable Topics, Iceberg multi-engine query routing, Netflix's high-throughput graph abstraction, Iceberg partition evolution, AWS Glue automation, and community thoughts on Databricks' BI migration tool.
-
Data This Week #16
5 min readDatabricks as a unified platform, PostgreSQL pluggable storage engines, Iceberg 1.11.0 highlights, database egress costs, JDBC query caching, and dbt column-level lineage.