Visual TL;DR. LLM context limit leads to MiniMax Sparse Attention. Demand for long context leads to MiniMax Sparse Attention. MiniMax Sparse Attention uses Index Branch. MiniMax Sparse Attention uses Main Branch. MiniMax Sparse Attention enables Breaks context barrier. MiniMax Sparse Attention delivers Practical speedups.
- LLM context limit: quadratic cost of standard softmax attention hinders ultra-long context
- Demand for long context: agentic workflows, code reasoning, persistent memory require millions of tokens
- MiniMax Sparse Attention: novel blockwise sparse attention mechanism built upon Grouped Query Attention
- Index Branch: scores and selects Top-k key-value blocks for each GQA group
- Main Branch: executes exact block-sparse attention over selected blocks
- Breaks context barrier: enables millions of tokens with significant compute reduction
- Practical speedups: optimized for GPU execution and efficient deployment across architectures
Visual TL;DR