Alibabas Qwen3.8-Max hat 16 Tage damit verbracht, ein eigenes Tool zu schreiben, und die Gewichte werden nächste Woche veröffentlicht
Alibaba veröffentlichte vollständige Details und Benchmarks für Qwen3.8-Max, ein 2,4 Billionen Parameter umfassendes Modell, das für tagelange Aufgaben entwickelt wurde. Fünf Fallstudien behandeln autonome Codierung, Papierreproduktion, Chipdesign und ein simuliertes Jahr Online-Handel.
Alibaba hat das Gesamtbild für Qwen3.8-Max dargelegt, das Mitte Juli vorgestellte Flaggschiffmodell, und dieses Mal sind auch die Zahlen und Fallstudien dabei. Das Modell hat insgesamt 2,4 Billionen Parameter mit 95 Milliarden aktiven Parametern pro Abfrage, und das Team sagt, dass die Gewichtungen für Hugging Face und ModelScope nächste Woche steigen werden. Damit wäre es das erste Modell der Qwen-Max-Klasse, das Sie herunterladen und selbst ausführen können.
Der Pitch besteht nicht aus besseren Antworten auf einzelne Fragen. Dies nennt man in der Fachwelt „Long-Horizon-Work“, also Aufgaben, die sich tagelang über Hunderte von Schritten erstrecken. Um dies zu verdeutlichen, veröffentlichte Alibaba fünf Fallstudien. Im ersten Schritt verbrachte das Modell 16 Tage damit, ein Befehlszeilentool namens oh-my-cli zu entwickeln: Es wandelte eingehende Benutzeranfragen in GitHub-Probleme um, wies sie sich selbst zu, schrieb den Code, führte die Tests aus und iterierte. Bis zum 30. Juli wurden 265 Commits, 127 Pull-Anfragen und 151 Probleme protokolliert, ohne dass ein Mensch die Tastatur berührte. In einem anderen Fall, bei dem nur eine Forschungsarbeit und kein Startercode zur Verfügung standen, reproduzierte es alle sechs Ergebnisse der Arbeit über etwa 125 Stunden Rechenzeit, testete dann 18 eigene Ideen und übertraf die ursprüngliche Methode bei einem Mathematik-Benchmark um 2,7 Punkte.
Zwei weitere Durchläufe: Testplanung statt Codierung. Als das Modell gebeten wurde, eine kryptografische Schaltung zu entwerfen, ging es von einem funktionierenden, aber aufgeblähten Entwurf mit 8.298 Logikgattern, den grundlegenden Schaltelementen auf einem Chip, aus und reduzierte ihn in etwa 500 Iterationen auf 678. Nach einem automatisierten Layoutdurchgang schrumpfte die physische Fläche um 81 Prozent. In einer Simulation eines gesamten Geschäftsjahres des Online-Handels, die auf anonymisierten Taobao- und Tmall-Daten basierte, begann es mit 100.000 Yuan, verhandelte im Klartext mit Lieferanten, kümmerte sich um Retouren und Taifune, entdeckte im Lieferantenpool versteckte Betrüger und endete mit 416.252 Yuan.
Was dahinter steckt. Alibaba führt den Sprung auf die Art und Weise zurück, wie das Unternehmen Reinforcement Learning durchführte, die Trainingsphase, in der ein Modell für gute Ergebnisse belohnt wird, anstatt ihm richtige Antworten zu zeigen. Anstatt an einzelnen Aufgaben zu üben, wurde in rund 4.000 verschiedenen Umgebungen geübt, die mehrtägige Arbeitsabläufe, verschachtelte Projektordner und verschiedene Agenten-Frameworks umfassten. Sein interner Score-Index für mehr als zehn Benchmarks stieg von 0,474 auf 0,725 und fiel dann leicht über diesen Punkt hinaus. Es lohnt sich, die Erwartungen auf dem Boden zu halten: Alle diese Zahlen stammen aus internen Versuchen, niemand außerhalb des Unternehmens hat sie überprüft, und ein Modell, das das Spielgeld in einer Simulation vervierfacht, hat keinen echten Laden betrieben. Auch der Wettbewerbsumfeld spielt eine Rolle. Der Kimi K3 von Moonshot öffnete seine Gewichte am 27. Juli und unabhängige Tests bestätigten seine Behauptungen auf der Realität.
Was das für dich bedeutet: heute nichts, es sei denn, Sie mieten GPU-Zeit stundenweise. Ein Modell mit 2,4 Billionen Parametern lässt sich nicht auf einem Laptop ausführen, daher werden die meisten Menschen es in der Praxis über einen gehosteten Dienst kennenlernen. Was wirklich nützlich ist, ist die Kompatibilitätsauswahl: Qwen3.8-Max spricht sowohl die API-Formate von OpenAI als auch Anthropic, sodass es durch Ändern einer Einstellung in Claude Code, Codex und ähnliche Tools integriert werden kann. Wenn Sie bereits pro Token für einen Agenten bezahlen, der Langzeitaufträge ausführt, ist das ein echter Preishebel, den es wert ist, getestet zu werden, sobald die Gewichte landen. Wenn Sie dies nicht tun, ist das Signal zum Mitnehmen, dass die offenen und geschlossenen Lager jetzt ungefähr einen Schritt voneinander entfernt sind und nicht mehr eine Generation.
Quellen
Quellen: https://qwen.ai/blog?id=qwen3.8
Zwei Forschungsteams lösten im Abstand von drei Stunden dasselbe offene Problem mit demselben KI-Modell
Ein MIT-Doktorand und zwei Professoren haben unabhängig voneinander dieselbe Frage in der Quantenkryptographie mit GPT-5.6 Sol Ultra gelöst und ihre Arbeiten innerhalb von drei Stunden nacheinander auf arXiv gepostet. Es wirft eine unangenehme Frage auf, was unabhängige Entdeckung jetzt bedeutet.