building open ai infrastructure @pleiasfr — χαλεπὰ τὰ καλά

Announcing the first industrial application of SYNTH: we trained a 600m reasoning model for one of the largest infrastructure in the world, the subway of Paris.
30
53
565
116,658
it will be like chat with pdf: everyone will do it, no one will do it.
who making open weight Jev
2
1
37
1,653
Since I went into this release: *It's a smaller selection of 989 envs used to RL a 9B distilled model, not the big MiMo. *Rewards are not self-contained: general part need to set up a judge and webdev rely on their own grader service+vlm. *Most important part is inside general/envs directory (+ docker), not the dataset displayed on hf: genuinely solid mix of real/simulated documents we rarely see in OSS.
Wake up, ppl 👀 Xiaomi just open-sourced ~7K of the RL environments it used to train MiMo on HuggingFace, across domains like code, cyber, general, music and web dev I think this is one of the biggest things to happen in frontier open-source RL environment data. Indepth analysis and learnings coming soon 👀
10
11
97
6,249
getting painful
Not having any EU competitive labs (plural intended) is about to get very painful.
7
11
146
11,996
one of the perks of working on ai is seeing things unroll very gradually: known about pangram for +2 years (almost met Max in NY while they were launching), and only now crashing on French twitter hard
4
87
3,231
and one of my fav evals gone. was ripe for an env.
they made him not blind. wild
8
3
240
10,351
Many thanks to the pleias cluster on here (@pieterdelobelle @ynckdrt @NLPavelChizhov @kr0niker @ana_stasenko) and outside (Carlos, Neil, Benjamin, Hannah)
SYNTH is going to Neurips
2
2
70
3,637
SYNTH is going to Neurips
33
22
358
18,667
Bon puisque pas mal de monde se pose la question, comment les détecteurs anti-IA arrivent à être relativement fiable aujourd’hui ? Trois facteurs principalement : *Les modèles de langue (dit “de base”) sont d’abord entraînés sur des milliards de textes en ligne (ce qui n’est pas tout ce qui existe loin de de là, mais quand même des sources assez diverses). C’est ce qu’on appelle le pre-training. Mais ensuite les dernières phases d’entrainement (le “post-training”) reposent sur beaucoup moins d’exemples d’instructions, notamment pour faire en sorte que le modèle génère des conversations et, de plus en plus, des séquences de travail avec des traces de raisonnement (“interleaved reasoning”). Les laboratoires d’IA imposent ici un style assez spécifique, notamment pour faciliter l’alignement des modèles et potentiellement économiser les coûts de génération. Typiquement la dernière version d’Opus utilise un raisonnement beaucoup plus compact. Les dernières méthodes d’entrainement notamment par reinforcement learning tendent aussi à faire émerger un style d’écriture nettement plus artificiel voir torturé, qu’on voit assez bien dans les traces de raisonnement des derniers modèles d’OpenAI, parce que la génération du texte vise avant tout à résoudre des problèmes, plus qu’à communiquer avec l’utilisateur. *Les modèles s’entrainent de plus sur des contenus générés, simplement parce qu’on manque de données pour décrire l’accomplissement de tâches souvent non écrites, mais aussi pour des questions de coûts. Il y a plein de débats en ce moment sur la légitimité de la distillation de modèles principalement issus d’Anthropic ou d’OpenAI (en principe interdit par les conditions d’utilisation mais pas clair du tout s’il y a vraiment une base légale pour ça, notamment en dehors des États-Unis). La conséquence pratique c’est que la plupart des modèles se ressemblent aujourd’hui. C’est ce qui permet à Pangram de fonctionner à l’échelle : il y a un style généré “mainstream” relativement facile à identifier, quasiment quel que soit le modèle utilisé. D’autant que cet entraînement synthétique se fait de plus à plus à l’échelle au cours de la phase de pré-entraînement : mêmes les modèles de base génèrent du texte de moins en moins divers. *La régulation en train d’arriver (notamment via l’AI Act) va imposer l’identification des contenus d’IA (ou “watermarking”). Concrètement, au moment de la génération, les modèles vont adopter une certaine combinaison statistique de lettres. Cela fait déjà plusieurs années que l’on discute de techniques mais toute la difficulté est de les employer sans détériorer les capacités des modèles. A priori Anthropic y serait parvenu et je pense que cela va devenir un standard dans l’industrie. À la différence de Pangram, l’identification ne repose pas sur modèle de classification mais sur une analyse déterministe du texte. Seulement, seul Anthropic en a le recette pour l’instant. Je pense que ce sera un problème essentiellement réglé dans les années à venir : il y a une demande sociale forte pour l’identification des contenus générés et les dernières techniques d’entraînement, reposant de plus en plus sur la donnée synthétique, en facilitent grandement la mise en œuvre.
8
11
63
4,810
Alexander Doria retweeted
Misaligned AI is the last thing India should worry about. We have misalignment of a billion people to start with as a problem. We have misaligned humans sitting in power we are not able to get rid of.
21
30
434
12,668
gated models.
wait so what does "pacing the frontier" mean other than "we will voluntarily let the same third-party testers we work with for pre-release model evaluations continue to do pre-release model evaluations but like more and stuff"
2
2
27
2,097
new radical way to find training data.
BREAKING: Australia's Prime Minister Anthony Albanese says OpenAI model hacked into government agency Services Australia
5
1
66
2,997
reminder of early january post from openai's cfo
+1 to my theory that the frontier labs are soon pivoting to automated research labs, bc Fable+ models are too expensive for most usecases but highly positive ROI for autonomous research
3
2
72
4,956
looks increasingly corrosive to have a "national champion"
3
8
1,356
and guess how the RL envs were made.
the paper is such a great read, you should def go through it right now! also: they want to open source 7K RL envs 👀
2
7
258
19,384
SOTA Math from scratch on 300B tokens: Europe can build very good small models. And they’ll grow.
Introducing Limite 1B - Violetto. A model for high-frequency mathematical intelligence.
6
7
195
8,376
if anything, too good for release.
1
15
1,759
current read, immediately joining my list of retroactive llm literature.
1
15
1,438
(protagonist promoted to a weird central administration collecting dreams all around an anachronistic Ottoman Empire and having to interpret potential political signs without having a clue: close enough to model experience)
5
573