Inferenz
Ein trainiertes KI-Modell ausführen, um eine Antwort zu erhalten, im Gegensatz zu seinem ursprünglichen Training.
Inferenz bedeutet, ein trainiertes KI-Modell zu nutzen: Du gibst ihm eine Anfrage und erhältst eine Antwort. Das unterscheidet sich vom Training, dem sehr viel teureren, einmaligen Vorgang, bei dem zunächst die Gewichte des Modells entstehen.
Diese Unterscheidung hilft beim Verständnis der KI-Kosten. Das Training eines Frontier-Modells kann monatelange Arbeit und enorme Rechenleistung erfordern, doch diese Kosten fallen einmal an. Inferenz wird dagegen bei jeder einzelnen Nutzung bezahlt. Deshalb rechnen Anbieter sie meist pro Token ab, und deshalb sind Verbesserungen so wichtig, die Inferenz schneller oder günstiger machen.
Aus demselben Grund ist der lokale Betrieb kleinerer Modelle praktikabel: Selbst ein leistungsfähiger Laptop kann für viele Aufgaben Inferenz leisten, obwohl er das Modell niemals selbst hätte trainieren können.
-
Großbritannien öffnet eine 100-Millionen-Pfund-Tür für kleine KI-Firmen und erlaubt ihnen, das geistige Eigentum zu behalten
-
Tencent Open-Sources Hy4, ein 770-Milliarden-Parameter-Modell, das für die Büroarbeit entwickelt wurde
-
OpenAI hat seinen eigenen Chip gebaut und die ersten Benchmarks sind gut
-
Anthropic hat den Mann engagiert, der die KI-Chips von Google entwickelt hat, und es ist nicht genau, warum
-
Ein Oxford-Spinout verkaufte Anthropic-Chips im Wert von 250 Millionen Dollar, die es noch nicht gibt
-
Das Ansehen seines eigenen Modells kostet OpenAI jetzt 20 Prozent mehr, und dafür wurde ein Trainingslauf unterbrochen
-
Anthropic zahlt Berichten zufolge 7 Milliarden Dollar für Software, die Chips weiterbringt
-
Ein Chip-Startup verdoppelte seinen Wert innerhalb eines Monats durch bewusste Unflexibilität
-
We Are Building an Invention Meant to Outgrow Its Inventors
-
The Most Valuable AI Skill Is Not Prompting. It Is Verification.
-
Someone Else Is Paying for Your AI, Just Not the Part You Think
-
AMD kauft Taalas, ein Startup, das ein komplettes KI-Modell in den Chip integriert
-
Jemand hat DeepSeek V4 Flash in der Produktion auf einer einzigen AMD-Karte zum Laufen gebracht und jeden benötigten Patch veröffentlicht
-
Amazon stellt die Entwicklung der meisten eigenen KI-Modelle leise ein
-
AMD und Cerebras tun sich zusammen, damit KI-Antworten schneller erscheinen
-
Nvidias nächste KI-Chips holen Berichten zufolge zehnmal mehr Arbeit aus derselben Energie
-
DeepSeek entwickelt einen eigenen KI-Chip, und nimmt erstmals externes Kapital auf