↓Skip to main content

Transformer

Why Large Language Models Reason and Behave Like Humans
·2142 words·11 mins
Large Language Models Artificial Intelligence Transformer Mechanistic Interpretability Sparse Autoencoders Machine Learning Reinforcement-Learning Reasoning Models Embodied AI
The Next-Generation Transformer Architecture: Beyond Self-Attention
·1308 words·7 mins
Transformer Large Language Models Deep Learning Artificial Intelligence State Space Models Machine Learning Neural Networks Attention Mechanism
mHC: DeepSeek’s Manifold-Based Evolution of Residual Connections
·592 words·3 mins
AI Research Neural Architecture Transformer Optimization