Transformer
Why Large Language Models Reason and Behave Like Humans
·2142 words·11 mins
Large Language Models
Artificial Intelligence
Transformer
Mechanistic Interpretability
Sparse Autoencoders
Machine Learning
Reinforcement-Learning
Reasoning Models
Embodied AI
The Next-Generation Transformer Architecture: Beyond Self-Attention
·1308 words·7 mins
Transformer
Large Language Models
Deep Learning
Artificial Intelligence
State Space Models
Machine Learning
Neural Networks
Attention Mechanism
mHC: DeepSeek’s Manifold-Based Evolution of Residual Connections
·592 words·3 mins
AI Research
Neural Architecture
Transformer
Optimization