Data Whisperer

Description
Navigating the Big Data Landscape


Интерактивный учебник SQL
https://querynomic.one/#/

по всем вопросам @just_vanich
We recommend to visit

Главная повестка про российскую экономику и бизнес. Инсайды, оперативные новости и цифры.

Сотрудничество: @nikmazel

Регистрация в РКН: https://rkn.link/uzA

Last updated 1 year, 6 months ago

Простым и понятным языком погружу вас в мир заработка на TON.

Чат: @vseznayka_chat
OTC: @vseznayka_otc
Реклама, сотрудничество: @vseznayka_admin

YT: www.youtube.com/@ton_vseznayka

*Информация в канале не является финансовой рекомендацией.

Last updated 1 year, 6 months ago

Официальный канал RAMENBEТ!

🌐Сайт
https://cutt.ly/OeLpQ0ib

💬Чат
https://t.me/+iUtv4zTSdpljMWZi

🥊Спорт
https://t.me/ramenbetsport

💸Рамемы
https://t.me/+ZS4Mf9lEyT40ZWMy

❔Помощь
https://t.me/realramenbet_bot

Last updated 1 year, 6 months ago

1 year, 6 months ago
**SQL Pipe Syntax теперь в Spark!**

SQL Pipe Syntax теперь в Spark!

В конце января Databricks тихо анонсировали внедрение синтаксиса pipe от Google для SQL в Spark. Это, пожалуй, одно из самых значимых обновлений Databricks за последние годы.

🔍 Что такое SQL pipe syntax? Это расширение SQL, разработанное Google, которое делает код более читаемым и гибким. Вместо сложных вложенных запросов - простые цепочки операций через pipe (|>).

Это расширение SQL было разработано Google сначала для внутреннего использования, а с лета 2024 года стало доступно в BigQuery. Оно было представлено в исследовательской статье SQL Has Problems. We Can Fix Them: Pipe Syntax In SQL.
Для тех, кто не хочет читать техническую статью в субботу (что вполне понятно), кто-то подробно объяснил это в этом посте. По сути, это расширение SQL (важно отметить - не новый язык запросов!), которое вводит pipes для связывания результатов SQL-операций. Лучше всего это объясняется на примере:

Было:

SELECT * FROM customers WHERE customer\_id IN ( SELECT DISTINCT customer\_id FROM orders WHERE order\_date >= '2024\-01\-01' )

Стало:

FROM orders |> WHERE order\_date >= '2024\-01\-01' |> SELECT DISTINCT customer\_id |> INNER JOIN customers USING(customer\_id) |> SELECT *

⚠️ Важно:
функционал пока доступен только в preview на runtime 16.2 в notebooks. В SQL Warehouses появится позже.

1 year, 6 months ago
**Cursor: Рекордный рост в истории SaaS-индустрии*****💰*** …

Cursor: Рекордный рост в истории SaaS-индустрии💰 $100 миллионов выручки всего за 12 месяцев! И это с командой всего из 12 человек.

👨‍💻 400 000 разработчиков уже стали платными пользователями, что делает рост компании не только впечатляющим, но и устойчивым.

🏆 Самое интересное: Cursor обгоняет даже $23-миллиардного гиганта Wiz по темпам роста!
Это абсолютный рекорд в истории SaaS-продуктов.

Феноменальный успех Cursor можно объяснить тремя ключевыми факторами:

1. Массовое принятие разработчикамиВ отличие от традиционных SaaS-компаний, ориентированных на корпоративные продажи, Cursor выбрал подход "разработчики прежде всего". С более чем 360,000+ индивидуальных разработчиков, платящих 20-40 долларов в месяц, компания создала устойчивую модель со средней стоимостью контракта в 276 долларов. Это массовое принятие стало главным драйвером быстрого роста.

2. AI-First редактор кодаCursor — это не просто еще один инструмент для кодинга, это редактор кода на базе ИИ, который трансформирует процесс разработки. Интегрируясь с экосистемой VS Code, Cursor предлагает:

• ИИ-помощь в реальном времени для написания, редактирования и автоматизации кода.

• Контекстно-зависимый ИИ, который помогает разработчикам рефакторить, отлаживать и оптимизировать свою работу.

• Повышенную продуктивность, делаянаписание кода более эффективным.

3. Модель роста, основанная на продуктеУспех Cursor подпитывается freemium-моделью, которая привлекает разработчиков на ранних этапах и стимулирует переход на платные планы.

• Бесплатный тариф включает 2,000 ежемесячных AI-автодополнений кода, демонстрируя возможности продукта.

• Когда разработчики видят ценность, они переходят на платные планы, стимулируя рост выручки.

• Крупные технологические компании, такие как OpenAI, Midjourney, Perplexity и Shopify, уже внедрили Cursor, что дополнительно подтверждает его эффективность.

Про то, как писать cursorrules был небольшой пост в канале.

Исходный пост

1 year, 6 months ago
[SQL Noir](https://www.sqlnoir.com/) - еще один обучающий …

SQL Noir - еще один обучающий проект, который делает изучение SQL более увлекательным.
Вместо учебных пособий вы находитесь в роли детектива и расследуете преступления решая SQL задачи.

1 year, 6 months ago
[PgAssistant](https://github.com/nexsol-technologies/pgassistant?tab=readme-ov-file#-manual-build) - это инструмент с открытым …

PgAssistant - это инструмент с открытым исходным кодом, призванный помочь разработчикам понять и оптимизировать производительность баз данных PostgreSQL. Он дает представление о поведении базы данных, выявляет проблемы, связанные со схемой, и помогает их исправить.

Ключевые возможности:
• Анализ поведения базы данных с детальными отчетами.

• Оптимизация схемы БД и выявление проблем.

• Управление библиотекой SQL-запросов через JSON.

• Проверка SQL-кода с помощью SQLfluff.

• Интеграция с OpenAI для оптимизации запросов.

• Поддержка локальных LLM (например, ollama).

• Получение DDL для топовых запросов.

• Встроенный PGTune для настройки параметров.

• Помощь в создании docker-compose файлов.

1 year, 6 months ago

TableFlow: Новый подход к обработке потоковых данных с Kafka и Iceberg

В мире потоковой обработки данных появляются всё новые инструменты, которые меняют наше представление о том, как работать с большими объёмами информации.
Один из таких инструментов — TableFlow, концепция, которая объединяет мощь Apache Kafka и Apache Iceberg.

Что такое TableFlow?
TableFlow — это подход, который стирает границы между потоковой обработкой и табличными данными. Он позволяет использовать Kafka как потоковый источник, а Iceberg — как табличное хранилище, обеспечивая гибкость и эффективность в обработке данных.

Почему это важно?
• Гибкость: Вы можете работать с данными как в режиме реального времени, так и в пакетном режиме.
• Масштабируемость: Kafka и Iceberg отлично справляются с большими объёмами данных.
• Упрощение архитектуры: TableFlow уменьшает сложность системы, объединяя потоковую и табличную модели.

Как это работает?
1. Данные поступают в Kafka.
2. С помощью TableFlow они преобразуются и записываются в Iceberg-таблицы.
3. Вы можете анализировать данные как в реальном времени, так и в историческом контексте.

Если вы хотите глубже разобраться в теме, рекомендую прочитать оригинальный пост: TableFlow: The Stream-Table Kafka-Iceberg Duality.
Так же запись
Apache Kafka Meets Apache Iceberg: Real-Time Data Streaming • Kasun Indrasiri • GOTO 2024

@data_whisperer

1 year, 7 months ago
***🦀*** **Как Rust тихо захватывает экосистему …

🦀 Как Rust тихо захватывает экосистему Python

В последнее время наблюдается интересная тенденция - Rust становится секретным ингредиентом многих инновационных инструментов Python. Как разработчик, ежедневно работающий с Python, я с интересом наблюдаю за эволюцией экосистемы.
Вот наиболее интересные проекты:

• Ruff: этот линтер работает невероятно быстро по сравнению с традиционными линтерами Python. Почему? Он написан на Rust. Речь идёт об ускорении в 10-100 раз.

• UV: ещё один инструмент, написанный на Rust - быстрый и надёжный установщик пакетов Python. UV как более быстрая альтернатива Poetry способная значительно ускорить установку зависимостей.

• Polars: эта библиотека DataFrame конкурирует с Pandas по производительности. И угадайте что? Под капотом - Rust.

• Maturin: делает создание Python-расширений на Rust предельно простым.

Самое интересное, что большинство Python-разработчиков даже не осознают, что используют инструменты на базе Rust. Похоже, Rust становится негласным помощником Python в вопросах производительности.

А что вы думаете об этой тенденции? Пробовали создавать расширения Python с помощью Rust?

@data_whisperer

1 year, 7 months ago
**SQL injection**

SQL injection

1 year, 7 months ago
**Langflow**

Langflow

Langflow - новый визуальный фреймворк для создания мультиагентных приложений и систем на основе RAG (Retrieval-Augmented Generation).

🔑 Ключевые особенности:
• Открытый исходный код
• Работает на Python
• Полностью настраиваемый
• Поддерживает различные LLM и векторные хранилища

💡 Интуитивно понятный интерфейс позволяет легко управлять AI-компонентами, что дает разработчикам возможность быстро создавать прототипы и воплощать свои идеи в реальные решения.

👨‍💻 Независимо от того, опытный ли вы AI-разработчик или только начинаете свой путь, Langflow предоставляет все необходимые инструменты для реализации ваших AI-проектов.

1 year, 7 months ago
𝐃𝐞𝐥𝐭𝐚 𝐋𝐚𝐤𝐞 𝐯𝐬. 𝐀𝐩𝐚𝐜𝐡𝐞 𝐈𝐜𝐞𝐛𝐞𝐫𝐠:

𝐃𝐞𝐥𝐭𝐚 𝐋𝐚𝐤𝐞 𝐯𝐬. 𝐀𝐩𝐚𝐜𝐡𝐞 𝐈𝐜𝐞𝐛𝐞𝐫𝐠:

Пост на substack

TLDR

🔹 Delta Lake создан для Spark-heavy workflows , предлагает тесную интеграцию с Databricks и беспрепятственный прием потоковой передачи.

🔹 Apache Iceberg спроектирован с учетом совместимости нескольких движков, что делает его идеальным выбором для команд, совместно использующих Spark, Trino, Flink и Snowflake. Метаданные имеют значение.

Распределенная модель Iceberg легко масштабируется, а журнал транзакций Delta Lake может создавать узкие места за пределами Spark.

Эволюция схемы? Iceberg позволяет изменять столбцы без перезаписи данных, а Delta требует явных действий по слиянию.

Разделение? Айсберг автоматически адаптируется; Delta нуждается в предварительно определенных разделах, что часто требует дорогостоящей перезаписи.

🚀Преимущество в производительности? Iceberg представляет файлы Puffin для расширенной оптимизации запросов, чего не хватает Delta Lake.

💡 Что выбрать? Если вы ставите олл-ин на Spark и Databricks, выбирайте Delta.

Нужна межплатформенная гибкость? Айсберг побеждает.

А с каким табличным форматом работаете вы?

@data_whisperer

We recommend to visit

Главная повестка про российскую экономику и бизнес. Инсайды, оперативные новости и цифры.

Сотрудничество: @nikmazel

Регистрация в РКН: https://rkn.link/uzA

Last updated 1 year, 6 months ago

Простым и понятным языком погружу вас в мир заработка на TON.

Чат: @vseznayka_chat
OTC: @vseznayka_otc
Реклама, сотрудничество: @vseznayka_admin

YT: www.youtube.com/@ton_vseznayka

*Информация в канале не является финансовой рекомендацией.

Last updated 1 year, 6 months ago

Официальный канал RAMENBEТ!

🌐Сайт
https://cutt.ly/OeLpQ0ib

💬Чат
https://t.me/+iUtv4zTSdpljMWZi

🥊Спорт
https://t.me/ramenbetsport

💸Рамемы
https://t.me/+ZS4Mf9lEyT40ZWMy

❔Помощь
https://t.me/realramenbet_bot

Last updated 1 year, 6 months ago