Apple scales up a diffusion-style language model to 1.7 billion parameters
Trained on 2.1 trillion tokens, then self-distilled to generate sentences in as few as 4 steps, testing an alternative to autoregression
50
Tag
Trained on 2.1 trillion tokens, then self-distilled to generate sentences in as few as 4 steps, testing an alternative to autoregression
That's the last story.