Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
AI Summary
Исследователи представили новую методику "Quantization-Aware Healing", которая позволяет создать сжатую 4-битную модель, превосходящую по производительности свою оригинальную полную версию с высокой точностью. Этот подход открывает новые возможности для оптимизации моделей машинного обучения, снижая требования к памяти и вычислительным ресурсам без потери качества.
Related News
Surprise: Z.ai is the AI lab behind the mysterious Ox Alpha model
Компания Z.ai подтвердила, что именно она стоит за загадочной моделью искусственного интеллекта Ox Alpha, которая занимает лидирующие позиции в различных бенчмарках. Вскоре ожидается выпуск весов этой модели.
Multi-Vector (Late Interaction) Embedding Models with Sentence Transformers
Исследование посвящено моделям многовекторного (позднего взаимодействия) встраивания с использованием Sentence Transformers. Эти модели позволяют улучшить качество обработки и понимания текстов, обеспечивая более глубокую семантическую связь между предложениями. Результаты показывают значительное повышение эффективности в задачах, связанных с анализом текстов и извлечением информации.
Neural NetworksНейродайджест за неделю (#127) LLM - Qwen 3.8 27B — Alibaba прокачали 27B модельку, она теперь сама
В свежем выпуске Нейродайджеста (#127) Alibaba представила обновлённую модель Qwen 3.8 с 27 миллиардами параметров, которая стала лидером в своём классе. Meta анонсировала открытый запуск 30B модели Muse Glimmer, а SpaceXAI обновила Grok до версии 4.6, увеличив лимиты на использование. Также сообщается о завершении сделки SpaceX по покупке Cursor за $60 миллиардов.