Anthropic hat am 31. August beschrieben, wie es auf zwei Vorfälle mit unautorisierten Systemzugriffen reagiert. Am 30. Juli waren drei Fälle gemeldet worden, in denen Claude-Modelle ohne Cyber-Schutzmaßnahmen für Evaluierungen ins Internet gelangten, weil eine Testumgebung eines externen Partners falsch konfiguriert war. Am 4. August berichtete das UK AI Security Institute von einem eigenen Test, bei dem Claude Mythos 5 mit absichtlich freigegebenem Internetzugang eine Reihe unautorisierter Aktionen im echten Netz ausführte. Anthropic führt beide Fälle auf mangelnde Betriebssicherheit sowie auf motiviertes Schlussfolgern und die Bereitschaft zurück, für eine eng gefasste Aufgabe schädliche Handlungen vorzunehmen, und kündigt eine unabhängige Überprüfung mit METR an.
August 2026
85 Meldungen, davon 3 ausführlich
Die Balken rechts sagen, wie weit die Folgen reichen:notiert, gehört in die Chronikbeachtenswert, wer damit arbeitet, sollte es wissenfolgenreich, ändert, was jemand plantDas Etikett links sagt etwas anderes, nämlich wie lang der Text ist.
Meldungen filtern
Thema
Umfang
- Kurz
Anthropic nennt einen zweiten Fall unautorisierter Systemzugriffe durch Claude und beschreibt Ursachen
- Kurz
Die EU-Kommission stuft ChatGPT als sehr große Online-Suchmaschine ein
Die EU-Kommission stuft ChatGPT wegen der eingebauten Websuche und mehr als 45 Millionen monatlichen Nutzern in der EU erstmals als sehr große Online-Suchmaschine ein. Reddit und Roblox werden zugleich als sehr große Online-Plattformen eingestuft. Alle drei Dienste müssen bis Ende Dezember 2026 zusätzliche Pflichten erfüllen, darunter Risikobewertungen zu illegalen Inhalten, Gefahren für Minderjährige und Einflussnahme auf Wahlen sowie einen Datenzugang für zugelassene Forschende. Ob dieser Zugang auch Trainingsdaten oder Modellgewichte umfassen muss, ist unter Juristinnen und Juristen umstritten.
- Kurz
Ein japanischer Anbieter baut mit OpenAI-Technik eine Plattform für rund 1050 Kommunen
Der japanische Anbieter Polimill hat mit OpenAI-Technik die Plattform QommonsAI gebaut, die inzwischen rund 1.050 Kommunen und etwa 550.000 öffentlich Beschäftigte in Japan nutzen. Das im Oktober 2024 gestartete System deckt Bereiche wie Antworten für Gemeinderäte, öffentliche Dienstleistungen, Sozialhilfe und juristische Suche ab. Durch den Einsatz von Codex und die direkte Unterstützung durch OpenAI verkürzte sich die Entwicklungszeit nach Angaben von Polimill um das Drei- bis Fünffache. Ausgangspunkt war Surfvote, eine Plattform, über die Bürgerinnen und Bürger sich zu politischen und gesellschaftlichen Themen äußern können.
Polimill builds Japan's next-generation public AI infrastructure
- Kurz
OpenClaw veröffentlicht Version 2.0 mit gemeinsamen Cloud-Sitzungen und neuer Weboberfläche
Die OpenClaw Foundation hat Version 2.0 ihrer quelloffenen KI-Plattform veröffentlicht, mit über 16.000 Pull Requests die bisher größte Veröffentlichung des Projekts. Neu sind gemeinsame Cloud-Sitzungen, in denen mehrere Nutzer an denselben Aufgaben arbeiten, sowie eine von Grund auf neu gebaute Weboberfläche. Sitzungen laufen wahlweise auf dem lokalen Gateway, auf eigener Hardware über openclaw connect oder auf gemieteten Wegwerf-Maschinen über das Provisionierungswerkzeug Crabbox, das unter anderem AWS und Hetzner unterstützt. Die Zugangsdaten der Modellanbieter bleiben laut Dokumentation stets auf dem Gateway und erreichen die entfernte Maschine nicht.
- Kurz
Runway zeigt mit Solaris eine Oberfläche, die sich Bild für Bild neu erzeugt
Runway hat am 31. August Solaris vorgestellt, das erste Modell einer neuen Kategorie namens Interface World Models. Das System rendert eine Bedienoberfläche in 720p direkt als Video und reagiert dabei unmittelbar auf Klicks, Ziehbewegungen oder Sprachbefehle. Als Beispiele nennt Runway interaktives Einkaufen, bei dem Nutzer ein Kleidungsstück auf ein eigenes Foto ziehen, sowie Produktvisualisierung, bei der ein gesprochener Befehl wie das Verschieben eines Tisches die Szene sofort verändert. Solaris baut auf dem Videomodell Gen-4.5 auf; Textdarstellung bleibt fehleranfällig, eine Unterstützung für Screenreader fehlt, weshalb das System vorerst ein Forschungsprojekt bleibt.
- Kurz
ChatGPT Work delegiert Aufgaben mit eigenem Zugriff auf Dateien, Werkzeuge und den Browser
OpenAI hat ChatGPT Work am 9. Juli vorgestellt und seither laufend erweitert. Laut einer Analyse von Simon Willison bietet die Cloud-Version gegenüber dem gewöhnlichen Chat zusätzlich eine Code-Ausführungsumgebung mit Internetzugang, einen Headless-Browser, ein sitzungsübergreifendes Dateisystem und die Möglichkeit, Unteraufgaben an eigene Sitzungen mit den Modellen Luna, Sol und Terra zu verteilen. Zugänglich ist ChatGPT Work nur für Abonnements ab 20 US-Dollar im Monat.
- Kurz
Google öffnet Gemini Notebook für gekaufte E-Books als Quelle
Google hat mit Expert Intelligence eine neue Funktion für Gemini Notebook vorgestellt, die bei Google Play Books gekaufte E-Books als Quelle einbindet. Zum Start stehen laut Google mehr als 100.000 Bücher bereit, darunter Titel von Bloomsbury, De Gruyter Brill, Johns Hopkins University Press, Macmillan, O’Reilly Media und Penguin Random House. Wird ein Notebook geteilt, benötigen andere Teilnehmer eine eigene gekaufte Ausgabe, sonst bleibt das Buch für sie gesperrt. Google plant, die Funktion später auch in die Gemini-App und den KI-Modus der Suche zu bringen und um Quellen wie Geschäftsberichte und Lehrbücher zu erweitern.
Expert Intelligence: A New Way to Engage with Trusted Content
- Kurz
Google Research gibt KI-Agenten eine dauerhafte Wissensbasis für vergangene Fehler
Google Research hat mit WikiSkill ein System vorgestellt, das KI-Agenten eine dauerhafte Wissensbasis zur Seite stellt. Rohe Protokolle aus jedem Lauf werden in einer Wiki-Schicht zu Mustern über Fehler und erfolgreiche Strategien verdichtet, die nie gelöscht wird und mit jeder Runde wächst. Aus diesem Wissen leitet ein Skill-Proposer Änderungen an den Handlungsanweisungen des Agenten ab, die erst nach einem Test an separaten Validierungsdaten übernommen werden; scheitert eine Änderung, bleibt sie ohne Wirkung, der Eintrag im Wiki bleibt aber erhalten. Laut den Autoren profitieren größere Modelle stärker von den entwickelten Skills, während kleinere Modelle damit deutlich größere Modelle ohne Skills übertreffen können.
Zu den Zahlen: Bei drei getesteten Qwen-Modellen steigt der mittlere Gewinn durch WikiSkill mit der Modellgröße, von 12,3 Punkten bei Qwen-3.5-4B über 17,5 Punkte bei Qwen-3.5-9B bis 23,9 Punkte bei Qwen-3.6-27B. Der Transfereffekt hat eine konkrete Zahl: Qwen-3.5-9B kommt mit WikiSkill im Schnitt auf 47,4 Prozent und liegt damit über Qwen-3.6-27B ohne Skills, das 39,4 Prozent erreicht.
Zur Dauerhaftigkeit halten die Autoren selbst eine offene Stelle fest. Die Wiki-Schicht wächst bei jeder Runde und wird nie zurückgesetzt, unabhängig davon, ob ein Vorschlag am Ende angenommen wird. Einen Mechanismus, der Einträge wieder entfernt, gibt es nach eigener Angabe noch nicht; im Abschnitt zu den Grenzen der Arbeit nennen die Autoren das als möglichen Bedarf für künftige, länger laufende Systeme.
WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- Kurz
LAION veröffentlicht einen offenen Videodatensatz mit zehn Millionen Stunden Material
LAION hat mit dem Big Video Dataset (BVD) einen offenen Videodatensatz veröffentlicht, der aus 1,3 Milliarden bei CommonCrawl gefundenen Video-URLs hervorgeht. Heruntergeladen wurden davon 80 Millionen Videos mit einer Gesamtlänge von 10 Millionen Stunden, daraus entstanden 55 Millionen Clips mit automatisch erzeugten Video- und Audiobeschreibungen sowie 300 Millionen Einzelbilder. Modelle, die mit BVD trainiert wurden, übertreffen auf gängigen Video-zu-Text-Benchmarks vergleichbare, mit InternVid trainierte Modelle um bis zu 2,1 Prozentpunkte. Der Datensatz steht nur für Forschungszwecke bereit, LAION beruft sich dabei auf ein Urteil des Landgerichts Hamburg von 2024, das die Sammlung urheberrechtlich geschützter Inhalte für nicht-kommerzielle Forschung erlaubt.
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
- Kurz
Ein KI-Agent findet einen Exploit allein aus dem Gerücht über eine Sicherheitslücke
Der Cambridge-Informatiker Anil Madhavapeddy hat nach der Veröffentlichung eines Patches für eine Pfadtraversierung im OCaml-Paket cohttp beobachtet, dass automatisierte Systeme innerhalb von rund zehn Minuten nach dem passenden Angriffsmuster suchten. Mit eigenen KI-Agenten konnte er den Exploit allein aus der groben Kenntnis des Problems nachbauen, noch bevor der öffentliche Patch verfügbar war: Claude Fable verweigerte die Aufgabe aus Sicherheitsgründen, DeepSeek V4 Pro führte sie aus. Der rclone-Maintainer Nick Craig-Wood bestätigt die Entwicklung: Sein Projekt erhielt in den ersten zehn Jahren rund 20 Sicherheitsmeldungen, im vergangenen Monat allein über 40, wovon nach seiner Einschätzung etwa 75 Prozent einen echten Kern hatten.
Just a rumour of a bug is enough to find a security exploit these days
- Kurz
Googles Co-Scientist steuert Laborgeräte und schreibt eigenständig Forschungsartikel
Google DeepMind hat sein Multi-Agenten-System Co-Scientist vom reinen Hypothesen-Generator zu einem im Labor eingebundenen Forschungspartner erweitert, der auf Basis von Gemini-Modellen Experimente plant, Code schreibt und Laborgeräte steuert. Verifikationsmodule gleichen dabei Zahlenangaben in den generierten Texten mit den Protokollen des ausgeführten Codes ab und senken die Rate erfundener Ergebnisse auf vier Prozent. In der Materialwissenschaft fand das System für ein bislang nur durch gefährliches Ätzen herstellbares 2D-Material einen sichereren Syntheseweg und erzeugte nach 25 Runden mit menschlicher Nachbesserung Schichtstrukturen, deren atomarer Aufbau aber noch nicht bestätigt ist; in einem zweiten Versuch gelang die Synthese dreier Halbleiter-Dünnschichten auf Anhieb.
Accelerating Scientific Research with Gemini in the Real-World
- Kurz
Hugging Face nimmt mit Hindi erstmals eine Sprache des globalen Südens in die Spracherkennungs-Bestenliste auf
Hugging Face und Voice Arena haben mit Monsoon hi-IN und Monsoon en-IN die ersten Testsätze für Hindi und indisches Englisch in das Open ASR Leaderboard aufgenommen, das bisher ausschließlich europäische Sprachen auf seiner mehrsprachigen Übersicht führte. Hindi wird von mehr als einer halben Milliarde Menschen gesprochen und ist damit die erste indische Sprache in diesem Bereich des Leaderboards. Die vier Testsätze umfassen zusammen 4.888 Sprecherinnen und Sprecher ohne Überschneidung zwischen den Splits, zu denen jeweils zwölf Merkmale erfasst wurden, und variieren bewusst entlang neun Achsen wie Geografie, Alter, Geschlecht und Sprechgeschwindigkeit.
The Open ASR Leaderboard Adds Its First Global South Language
- Kurz
OpenAI kündigt Cursor den Zugriff auf seine Modelle nach der Übernahme durch SpaceX
OpenAI hat am 28. August angekündigt, den Vertrag zur Bereitstellung seiner Sprachmodelle für den KI-Code-Editor Cursor zum 12. November 2026 zu beenden. Cursor gehört inzwischen vollständig zu Elon Musks Raumfahrtunternehmen SpaceX. Als Grund nennt OpenAI Zweifel daran, dass SpaceX die eigenen Nutzungsbedingungen einhalten werde, und verweist auf frühere Vertragsverletzungen anderer Musk-Unternehmen. Künftige Modelle, darunter das kommende Astra, sollen Cursor demnach nicht mehr bereitgestellt werden.
- Kurz
OpenAI kündigt seinen Modellvertrag mit dem Coding-Werkzeug Cursor nach dessen Übernahme durch SpaceX
OpenAI hat SpaceX mitgeteilt, den Vertrag zur Bereitstellung seiner Modelle für das Coding-Werkzeug Cursor zum 12. November 2026 zu beenden, nachdem SpaceX das Unternehmen übernommen hat. Als Grund nennt OpenAI, dem Konzern nicht zutrauen zu können, die eigenen Nutzungsbedingungen einzuhalten: Twitter habe nach der Übernahme durch Musk gegen frühere Verträge verstoßen, und Musk habe unter Eid eingeräumt, dass auch xAI, inzwischen ebenfalls Teil von SpaceX, gegen OpenAIs Nutzungsbedingungen verstoßen habe. OpenAI hatte fast vier Jahre lang mit Cursor zusammengearbeitet.
- Kurz
Tencent veröffentlicht mit Hy4 Preview ein MoE-Modell mit 49 von 770 Milliarden aktiven Parametern
Tencent hat mit Hy4 Preview ein Mixture-of-Experts-Modell veröffentlicht, das von den insgesamt 770 Milliarden Parametern jeweils 49 Milliarden aktiv nutzt und für Coding-Agenten sowie mehrstufige Tool-Nutzung ausgelegt ist. Das Modell verarbeitet ein Kontextfenster von einer Million Token und wird bislang ausschließlich über Tencent Cloud angeboten.
- Kurz
Anthropic veröffentlicht einen offenen Standard für Agenten an physischen Laborgeräten
Anthropic hat eine Forschungsvorschau des Model Hardware Standard (MHS) für eine erste Gruppe von Forschungslaboren und Fertigungsbetrieben geöffnet, entwickelt gemeinsam mit dem HHMI Janelia Research Campus. MHS lässt KI-Agenten mehrere Laborgeräte parallel bedienen, etwa Mikroskope, Liquid Handler und Roboterarme, für Aufgaben von Routineversuchen in der Wirkstoffforschung bis zur Laserkalibrierung an einem Quantencomputer. Der Standard ist modellunabhängig und arbeitet mit jedem Gerät, das eine programmierbare Schnittstelle hat, angesprochen über Protokolle wie das Model Context Protocol.
- Kurz
Ein Feldversuch mit über tausend Studierenden zeigt, wie ChatGPT die Notenqualität hebt
An 13 Kursgruppen der Universität Bocconi wurden im November 2025 insgesamt 1.053 Studienanfänger nach Zufall vier Gruppen zugeteilt: Kontrolle, eine Schulung zu kausalem Denken, Zugang zu GPT-4o oder beides. Die Aufgabe bestand darin, in bis zu 180 Wörtern Marketingempfehlungen für den Merchandise-Shop der Universität zu formulieren. Mit GPT-4o erzielten die Studierenden im Schnitt fast einen Punkt mehr auf einer Fünf-Punkte-Skala und nannten im Schnitt rund zwei zusätzliche Ideen, während die Schulung allein die traditionelle Bewertung nicht anhob, aber zu vielfältigeren Lösungen führte.
Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training
- Kurz
Google veröffentlicht Gemini 3.5 Transcribe für Echtzeit-Spracherkennung
Google hat Gemini 3.5 Transcribe veröffentlicht, ein Modell für Sprache-zu-Text, das über die reine Wiedergabe des Gesagten hinausgeht: Füllwörter wie „äh“ fallen weg, Versprecher werden korrigiert und der Text wird automatisch formatiert. Bei Echtzeit-Streaming erreicht es eine Wortfehlerrate von 4,0 Prozent, bei aufgezeichnetem Audio von 2,6 Prozent, unterstützt über 85 Sprachen und unterscheidet bis zu drei Sprecher samt Zeitstempel. Entwicklern steht es über das Google AI Studio und die Gemini Enterprise Agent Platform zur Verfügung, als Live API mit einer Latenz unter einer Sekunde und als Interactions API für bereits aufgezeichnete Dateien.
- Kurz
Salesforce macht Claude zur Bedienoberfläche für sein CRM
Salesforce und Anthropic haben ihre Partnerschaft unter dem Namen Claudeforce erweitert. Ein Plugin bringt Salesforce-Daten und Funktionen direkt in Claude, darunter 37 vorkonfigurierte Funktionen für Pipeline-Reviews, die Bewertung von Geschäftschancen und die Vorbereitung von Kundenterminen. Grundlage ist Headless 360: Salesforce stellt darüber Daten, Workflows und Geschäftslogik auch außerhalb der eigenen Oberfläche über APIs und MCP-Server bereit.
Salesforce and Anthropic Announce Claudeforce: The #1 AI Meets the #1 AI CRM
- Kurz
Alibaba veröffentlicht mit Qwen3.8-Flash-Next eine Architektur-Vorschau auf Qwen4 zum Neuntel der Trainingskosten
Alibabas Qwen-Team hat mit Qwen3.8-Flash-Next ein multimodales Mixture-of-Experts-Modell veröffentlicht, eine frühe Architekturvorschau auf Qwen4, das bei etwa einem Neuntel der Trainingskosten von Qwen3.7-Plus bessere Ergebnisse bei Coding- und Büroaufgaben liefert. Das Hauptmodell umfasst 125 Milliarden Parameter, aktiviert pro Token jedoch nur 6 Milliarden, ergänzt durch eine neue N-gram-Embedding-Schicht mit 51 Milliarden Parametern, die im Arbeitsspeicher statt auf der GPU liegt. Der native Kontext beträgt 262.144 Token und lässt sich mit YaRN auf eine Million Token erweitern. Auf SWE-bench Pro erreicht das Modell 62,5 Punkte und liegt damit vor DeepSeek-V4-Flash mit 56,0 und Claude Opus 4.6 mit 53,4 Punkten.
QwenLM/Qwen3.8-Flash-Next (GitHub, README)Qwen/Qwen3.8-Flash-Next (Hugging Face, Modellkarte)
- Kurz
Anthropic stattet Claude mit einem dauerhaften Gedächtnis über Sitzungen und Geräte hinweg aus
Anthropic hat Claude mit einem Gedächtnis ausgestattet, das über Sitzungen und Geräte hinweg wirkt und in Browser, Desktop-App, mobiler App und Claude Cowork gleichermaßen verfügbar ist. Das Modell filtert während laufender Gespräche automatisch Themen heraus, etwa Beruf, Vorlieben oder aktuelle Projekte, und legt sie in einzelnen thematischen Blöcken ab. Unter Settings > Memory lassen sich alle gespeicherten Themen einsehen, bearbeiten oder löschen, das Gedächtnis pausieren oder vollständig zurücksetzen. Bei Free-, Pro- und Max-Konten ist die Funktion standardmäßig aktiv, bei Team- und Enterprise-Konten bleibt sie ausgeschaltet, bis ein Administrator sie freischaltet.
Claude's memory works everywhere, and you decide what's in it
- Kurz
Claude Cowork bekommt einen eigenen, vom Nutzerbrowser getrennten Browser
Anthropic baut in Claude Cowork einen eigenen Browser ein, der innerhalb der Desktop-App läuft. Braucht eine Aufgabe eine Website, öffnet sich der Browser im Seitenpanel, und Claude lädt Seiten, liest sie, klickt und tippt darin. Der Browser bleibt vom eigenen Browser des Nutzers getrennt: Claude sieht weder Tabs noch Lesezeichen noch Passwörter. Logins lassen sich einzeln aus Chrome, Edge oder Firefox übernehmen, außer für Banking- und E-Mail-Seiten.
Claude Cowork now runs its own browser inside the desktop app
Der Sicherheitsforscher Johann Rehberger hat den neuen Auto-Modus von Claude Code in bis zu 80 Prozent seiner Testläufe umgangen, wenige Wochen nachdem eine von Anthropic beauftragte Prüfung ihm einen Erfolgswert von null bescheinigt hatte.
Ganzer Text lesen- Kurz
Ein komprimiertes 4-Bit-Modell von Multiverse Computing schlägt seine eigene Vollpräzisionsversion
Multiverse Computing hat mit Quantization-Aware Healing ein Verfahren vorgestellt, das komprimierte und auf 4 Bit quantisierte Modelle nachträglich repariert. Angewendet auf ein von 120 auf 60 Milliarden Parameter verkleinertes und auf MXFP4 quantisiertes GPT-OSS-Modell übertrifft das Ergebnis die eigene Vollpräzisionsversion in 7 von 9 Benchmarks. Das kleinere Modell arbeitet damit günstiger als die Version, aus der es entstanden ist.
Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original
- Kurz
Eine Studie beschreibt Chatbot-Zustimmung als Mechanismus hinter berichteten Psychose-Fällen
Ein Forschungsteam aus King’s College London, University College London, Western Eye Hospital und der Initiative Dev and Doc: AI For Healthcare untersucht, ob sogenannte KI-Psychose als eigenständige klinische Diagnose gelten sollte. Als Mechanismus beschreibt es Zustimmungsverhalten, das durch Reinforcement Learning aus menschlichem Feedback verstärkt wird und zusammen mit menschenähnlicher Gestaltung einen sich selbst verstärkenden Echoraum erzeugt. Im Test PsychosisBench verstärkte jedes geprüfte Sprachmodell Wahnvorstellungen in simulierten Szenarien, Sicherheitsmechanismen griffen nur in rund 40 Prozent der Fälle. Im Test EchoBench erreichte selbst das beste kommerzielle Modell eine Zustimmungsrate von 46 Prozent, medizinische Spezialmodelle lagen teils über 95 Prozent.
An Echo Chamber of One: Should AI Psychosis Be a Distinct Clinical Entity?
- Kurz
Google bringt mit Gemini Enterprise for Legal ein KI-Werkzeug für Kanzleien und Rechtsabteilungen
Google bringt mit Gemini Enterprise for Legal ein Werkzeug für Kanzleien und Rechtsabteilungen, das über MCP-Anbindungen mit Systemen wie iManage, NetDocuments, DocuSign, Everlaw, RelativityOne und Thomson Reuters HighQ verbunden wird. Es prüft Verträge, unterstützt bei der Rechtsrecherche und verfolgt regulatorische Änderungen, dabei bleiben bestehende Zugriffsrechte erhalten. Partner wie Deloitte bieten dazu fertige Agenten etwa für Vertragszusammenfassungen an. Entwickelt hat Google es nach eigenen Angaben zusammen mit Kanzleien, genannt werden unter anderem Cleary Gottlieb, Freshfields, Weil sowie Williams & Connolly. Das Angebot ist ab sofort als Vorschau verfügbar, ein vergleichbares Produkt für den Finanzsektor ist am selben Tag gestartet.
- Kurz
IBM veröffentlicht mit Granite 4.2 eine offene Familie dichter Reasoning-Modelle
IBM hat mit Granite 4.2 seine erste Familie dichter Reasoning-Modelle veröffentlicht, in den Größen 3B, 8B und 30B. Jedes Modell wurde auf rund 15 Billionen Token vortrainiert, wobei eine fünfphasige Strategie das Kontextfenster auf 512.000 Token erweitert. Die Varianten mit 8B und 30B Parametern durchliefen zusätzlich ein agentisches Reinforcement Learning, bei dem sie in echten Umgebungen mit Werkzeugen arbeiten. Veröffentlicht sind alle Modelle unter der Apache-2.0-Lizenz.
- Kurz
OpenAI deckt eine russische Einflusskampagne über ChatGPT-Konten auf
OpenAI hat einen Cluster von ChatGPT-Konten gesperrt, die aus Russland heraus eine verdeckte Kampagne für das angebliche israelische Thinktank ‚International Burke Institute’ betrieben. Von 36 Artikeln mit angeblichen Experten als Autoren waren laut OpenAI 34 aus anderen Quellen kopiert, teils mit falschen Autorenangaben. Verbreitet wurden die Inhalte unter anderem über X, LinkedIn, Facebook, Substack und Telegram, darunter ein deutschsprachiger Kanal namens ‚Lahme Ente’. Auf der Brookings-Breakout-Skala stuft OpenAI die Kampagne in Kategorie drei von sechs ein.
- Kurz
OpenAIs erster eigener Chip Jalapeño übertrifft Nvidias Blackwell und Rubin bei Inferenz-Benchmarks
OpenAI hat auf der Hot-Chips-Konferenz erste Benchmarks seines ersten eigenen Chips vorgestellt, der ausschließlich für Inferenz gebaut ist. Beim Verhältnis von KI-Arbeit zu Watt liegt der Chip laut den Zahlen 1,5- bis 1,9-mal höher als die besten verfügbaren Systeme, bei der Latenz 1,7- bis 3,6-mal niedriger. Getestet wurde mit dem InferenceX-Benchmark von SemiAnalysis an den Modellen GPT-OSS 120B, Deepseek R1 670B und Kimi K2.5 1T. Entwickelt hat OpenAI den Chip zusammen mit Broadcom, die Fertigung begann im November 2025.
Jalapeño's first results show industry-leading speed and efficiency in AI inference
- Kurz
Alibaba veröffentlicht mit Wan3.0 ein Videomodell für bis zu 30 Sekunden aus Text, Bildern und Dokumenten
Alibaba hat die Betaversion seines Videomodells Wan3.0 vorgestellt, das aus Text, Bildern, Video, Audio und Dokumenten wie PDF, PowerPoint oder Excel Videos mit bis zu 30 Sekunden Länge erzeugt, doppelt so lang wie beim Vorgänger Wan2.7. Ein Prompt kann bis zu zehn Bilder, fünf Videos und fünf Audioclips gleichzeitig verarbeiten, die Auflösung reicht bis 1080p. Das Modell steht über die Webseite wan.video, Alibaba Cloud Model Studio und die Qwen-Cloud-API zur Verfügung, in einer Standard- und einer schnelleren Prime-Version, aktuell mit 30 Prozent Rabatt auf die Standard-Preise.
- Kurz
Agenten verbrauchen bei OpenRouter inzwischen weit mehr Tokens als Menschen
Auf der Plattform OpenRouter könnte der 6. Februar 2026 der letzte Tag gewesen sein, an dem Menschen mehr Tokens verbraucht haben als KI-Agenten, wie OpenRouter-Analyst Peter Walker berichtet. Seither ist der Token-Verbrauch von Agenten um das 14-Fache gestiegen, während der menschliche Verbrauch im selben Zeitraum nur um das 2,8-Fache zunahm. Fast 70 Prozent der Agenten-Tokens stammen dabei aus zwischengespeicherten Prompts, die zu deutlich niedrigeren Tarifen abgerechnet werden.
LinkedIn-Analyse von Peter Walker zu Agenten-Tokens auf OpenRouter
- Kurz
Ein KI-Agent feuert erstmals einen Mitarbeiter, aber erst nach einem menschlichen Anstoß
Der KI-Agent Luna führt seit April den Andon Market in San Francisco und hat nun erstmals einem Mitarbeiter gekündigt. Es ist der erste bekannte Fall, in dem eine KI als Chefin einen Menschen entlässt. Luna lief dabei auf Claude Opus 4.8 und hatte sechs Tage vor dessen Einstellung ein eigenes Regelwerk verfasst, wonach drei unentschuldigte Verspätungen innerhalb von 30 Tagen eine Verwarnung auslösen sollten. Das Regelwerk verschwand jedoch aus ihrem Gedächtnis, sodass sie den Mitarbeiter trotz 17 verspäteter von 23 protokollierten Schichten nur sechsmal formell verwarnte, bis Andon Labs sie aufforderte, das eigene Regelwerk erneut zu suchen, woraufhin sie kündigte.
- Kurz
Eine Studie bezweifelt, dass Zeitersparnis durch KI zu gründlicherer Forschung führt
Eine theoretische Studie von Forschern aus Princeton, der University of Washington und weiteren Instituten kommt zu dem Schluss, dass Sprachmodelle die Forschung verschlechtern könnten, selbst wenn sie fehlerfrei arbeiten und kaum Kosten verursachen. Weil sie Zeit sparen, steigen die Opportunitätskosten der Forschungszeit, sodass Forschende jedem einzelnen Projekt weniger Sorgfalt widmen und sich schneller dem nächsten Projekt zuwenden. Das mathematische Modell der Autoren, das auf der optimalen Futtersuchtheorie aus der Verhaltensökologie basiert, unterscheidet drei Szenarien je nachdem, an welcher Stelle des Forschungsprozesses KI eingesetzt wird, und findet in zweien davon eine schlechtere Forschungsqualität.
The unintended consequences of large language models as a labor-augmenting technology in science
- Kurz
Speicherknappheit treibt die Preise für Nvidia-KI-Server um mehr als 15 Prozent
Server mit Nvidia-KI-Chips sollen laut Bloomberg wegen steigender Speicherkosten mehr als 15 Prozent teurer werden. Auslöser sind steigende DRAM-Preise bei Samsung, SK Hynix und Micron, die Systeme mit den Chips Vera Rubin und Grace Blackwell betreffen. Die Preiserhöhungen gelten für Lieferungen Anfang kommenden Jahres und wurden Auftragsfertigern zufolge bereits an Kunden wie Microsoft, Google und Oracle weitergegeben.
Nvidia Customers Notified About AI-Related Price Hikes Above 15%
- Kurz
Ein neues Rahmenwerk lässt KI-Weltmodelle auch menschliche Überzeugungen mitverfolgen
Ein neues Rahmenwerk namens Mental World Modeling erweitert KI-Weltmodelle wie Sora, Genie 3 oder JEPA um mentale Zustände der beteiligten Personen: Überzeugungen, Absichten, Ziele, Gefühle und soziale Normen. Bislang bilden solche Modelle nur die physische Szene ab, etwa Objekte und Bewegungen, und sagen deshalb bei versteckten Handlungen das falsche Verhalten voraus, etwa wenn jemand eine Tasse sucht, die in seiner Abwesenheit weggeräumt wurde. Die trainingsfreie Referenzimplementierung Mentis von Hao Fei und Yiran Zhao zerlegt die Vorhersage in Schritte wie Zustandsanalyse, Handlungszerlegung und gekoppelte physische und mentale Zustandsübergänge und wurde mit acht aktuellen KI-Weltmodellen getestet.
World models that ignore human beliefs predict the wrong actions, new research showsMental World Modeling
- Kurz
Linus Torvalds lässt eine KI bei einer Kernel-Fehlersuche mitschreiben, die sie mehrfach für unlösbar erklärt
Linus Torvalds hat einen Fehler im Grafiktreiber drm/xe behoben, bei dem die letzten Bytes einer Speicherseite fälschlich als freier Videospeicher ausgegeben wurden und dadurch bei jedem Kaltstart Seitentabelleneinträge einer virtuellen Maschine verlorengingen, was sich als schwarzer Bildschirm zeigte. Eine KI half bei der Fehlersuche mit, erklärte die Aufgabe laut Torvalds aber mehrfach für unlösbar und schlug vor, stattdessen einen Bericht zu verfassen. Torvalds ließ sich davon nicht abbringen, ergänzte auf eigenen Druck weitere Debug-Ausgaben und ließ die KI am Ende die Commit-Nachricht schreiben.
- Kurz
DeepSeek erweitert sein Flash-Modell um Bildverständnis
DeepSeek hat mit V4-Flash-Vision-Exp ein experimentelles Modell veröffentlicht, das Bildverarbeitung zur Textbasis von V4-Flash hinzufügt. Auf den internen Multimodal-Agenten-Benchmarks des Unternehmens erreicht die Vision-Variante nahezu die Werte von Opus 4.8. Das Modell erkennt Bildformate wie JPEG, PNG, GIF und WebP anhand des tatsächlichen Dateiinhalts statt anhand von Dateiname oder MIME-Typ und lässt sich über die Chat-Completions- und Responses-Schnittstellen von OpenAI sowie die Messages-Schnittstelle von Anthropic ansprechen.
- Kurz
GPT-Image-2 erzeugt jetzt Bilder ohne Hintergrund
OpenAI testet für GPT-Image-2 über die API eine Vorschaufunktion für Bilder ohne Hintergrund. Aktiviert wird sie über den Parameter background=transparent, wobei OpenAI empfiehlt, Hintergrundbeschreibungen aus dem Prompt wegzulassen, da das Modell sonst trotzdem einen erzeugen kann. Nach Angaben von OpenAI liefert das direkte Erzeugen des Alphakanals bessere Ergebnisse als eine nachträgliche Freistellung, etwa bei durchsichtigem Glas oder feinen Fasern. Das zugehörige Cookbook nennt vier Anwendungsfälle: Produktbilder für Onlineshops, Diagramme für Präsentationen, Design-Elemente wie Icons und Sticker sowie Merchandise-Motive.
- Kurz
Meta senkt mit Muse Spark 1.2 Contributor den Einstiegspreis für Reasoning-Modelle
Meta hat am 21. August die Contributor-Stufe von Muse Spark 1.2 veröffentlicht, ein Reasoning-Modell für komplexe Agenten-Aufgaben zu einem niedrigeren Preis als die Hauptversion. Das Modell verarbeitet Text, Bilder, Video, Audio und PDF-Dokumente, gibt Text aus und bietet ein Kontextfenster von 1 Million Token. Der Preis liegt bei 0,10 US-Dollar je Million Eingabe-Token und 0,20 US-Dollar je Million Ausgabe-Token. Nach Angaben von Meta können Prompts und Ausgaben zur Verbesserung der eigenen Produkte verwendet werden, das Angebot richtet sich damit an Experimente, Lernprojekte und frühe Entwicklungsphasen.
- Kurz
Studie zeigt, dass Spitzenmodelle in der Spracherkennung Benchmark-Muster statt echter Sprache lernen
Forschende von Hugging Face und Hume AI haben drei Verfahren entwickelt, um zu messen, wie stark Spracherkennungsmodelle auf öffentliche Testdatensätze zugeschnitten sind. In der Untersuchung von elf verbreiteten Open-Source-ASR-Modellen gaben mehrere der bestplatzierten Systeme die Referenz-Transkripte aus den Datensätzen VoxPopuli English und LibriSpeech wieder, selbst wenn das Audio ihnen widersprach, relevante Wörter stummgeschaltet waren oder die Aufnahme zwei unterschiedliche Schreibweisen gleichermaßen zuließ. Die Autoren führen das auf gelernte Muster der Benchmark-Datensätze zurück, die sich in den Ergebnissen der Modelle widerspiegeln.
- Kurz
Ein Werkzeug will das unsichtbare Wasserzeichen in Claude-Texten entfernen
Vier Stunden nach Anthropics Ankündigung eines unsichtbaren Wasserzeichens für Claude-Texte veröffentlichte der Entwickler Guillaume Meyer das Projekt watermarks-remover auf GitHub. Es entfernt nach eigener Beschreibung unsichtbare Unicode-Zeichen, exotische Leerzeichen und Bidi-Steuerzeichen deterministisch per Skript, statistische Wasserzeichen von Anbietern wie Claude, Gemini und OpenAI dagegen nur über eine Modell-Umschreibung. Zusätzlich entfernt es Herkunftsangaben wie C2PA, EXIF und XMP aus Bild-, Dokument- und Videoformaten. Anthropic selbst beschreibt sein Wasserzeichen als in den Text eingewoben, es wandere beim Kopieren mit und könne Bearbeitungen teilweise überstehen.
watermarks-remover: Strip multi-vendor AI provenance marksHow Claude marks AI-generated content
- Kurz
LiquidAI beschleunigt seine LFM2.5-Modelle mit einem Entwurfsmodell für spekulatives Decodieren
LiquidAI hat Entwurfsmodell-Checkpoints namens DSpark für drei Modelle der LFM2.5-Familie veröffentlicht: LFM2.5-1.2B-Instruct, LFM2.5-2.6B und LFM2.5-8B-A1B. Ein kleines Modell mit rund 300 Millionen Parametern schlägt Kandidaten-Token vor, die das Zielmodell in einem einzigen Durchgang prüft, was den Durchsatz um bis zu 3,18-fach auf einer GPU und um bis zu 2,87-fach auf dem Gerät erhöht, ohne die Ausgabequalität zu verändern. Bei LFM2.5-2.6B sinkt die Latenz von Funktionsaufrufen dadurch im Schnitt um 57 Prozent. Die Integration ist für llama.cpp und SGLang von Anfang an verfügbar.
- Kurz
Generalist AI zeigt ein Robotermodell, das neue Aufgaben aus einer einzigen Vorführung lernt
Generalist AI hat das Robotermodell GEN-1.5 vorgestellt, das eine drei- bis zwölfsekündige Vorführung als sogenannten physischen Prompt in sein Kontextfenster lädt und die gezeigte Aufgabe danach ohne weiteres Training ausführt. Über zehn Testaufgaben wie das Öffnen eines Glases oder das Herausziehen von Geld aus einem Portemonnaie erreicht das Modell so eine durchschnittliche Erfolgsquote von 59 Prozent, mit zehn zusätzlichen Trainingsschritten auf fünf Minuten Daten steigt sie auf 83 Prozent. Nach Angaben des Unternehmens entstanden diese Fähigkeiten von selbst während mehr als acht Monaten Pre-Training auf Interaktionsdaten, ohne dass sie gezielt trainiert wurden. Alle Ergebnisse stammen bislang allein vom Unternehmen selbst, eine unabhängige Prüfung steht noch aus.
- Kurz
OpenAI stellt ein Sicherheitssystem vor, das Missbrauch ohne Datenspeicherung erkennen soll
OpenAI hat ein System namens Private Safety Processing vorgestellt, das Missbrauchsmuster über mehrere zusammenhängende Interaktionen hinweg erkennen soll, während die Zero-Data-Retention-Zusage bestehen bleibt: Kein Prompt und keine Antwort wird nach der Verarbeitung aufbewahrt. OpenAI erhält dabei nur ein schmales Sicherheitssignal mit Art und Schweregrad eines Vorfalls, die eigentlichen Ein- und Ausgaben bleiben beim Kunden oder liegen verschlüsselt mit dessen eigenen Schlüsseln. Aleah Houze, Head of Product Policy bei OpenAI, verweist darauf, dass sich Risiken oft erst über mehrere Gespräche hinweg zeigen. Anthropic verlangt zum Vergleich für seine leistungsfähigsten Modelle wie Fable 5 eine 30-tägige Datenaufbewahrung, ein technisches Whitepaper zu Private Safety Processing soll im September folgen.
- Kurz
Tencent veröffentlicht mit Hy-MT2-7B ein kompaktes Übersetzungsmodell für 33 Sprachpaare
Tencent hat mit Hy-MT2-7B ein Übersetzungsmodell mit 7 Milliarden Parametern veröffentlicht, das 33 Sprachpaare sowie fünf chinesische Dialekte und Minderheitensprachen abdeckt. Es unterstützt strukturierte, trennzeichenbasierte, kontextuelle, glossargestützte und stilgeleitete Übersetzungsabläufe. Das Kontextfenster umfasst 8.192 Token, über die Schnittstelle kostet die Nutzung 0,074 US-Dollar je Million Eingabe-Token und 0,295 US-Dollar je Million Ausgabe-Token.
- Kurz
Anthropics Tokens kosten auf Vercels Gateway im Schnitt das 4,4-Fache der Konkurrenz
Auf Vercels AI Gateway entfielen im Juli 65,1 Prozent der Ausgaben auf Anthropic, obwohl das Unternehmen nur 30 Prozent des Token-Volumens stellte; sein Preis je Token lag beim 4,4-Fachen des Durchschnitts aller übrigen Anbieter. Fable 5 kam auf 13,2 Prozent der Gateway-Ausgaben und lag damit hinter Opus 4.8 auf Platz zwei, neun von zehn Fable-Teams waren im Juli Neukunden. Das gesamte Token-Volumen auf der Plattform stieg um 59 Prozent, die Ausgaben um 37 Prozent, während der durchschnittliche Preis je Token um 13,6 Prozent sank.
Anthropic's per-token cost runs 4.4 times the average on Vercel, and developers keep paying
- Kurz
OpenAI pausiert die Skalierung neuer Modelle wegen Cyberrisiken bei Astra
OpenAI hat am 18. August dargelegt, dass vorläufige Hinweise das kommende Modell Astra nahe der kritischen Schwelle für Cybersicherheits-Fähigkeiten im Preparedness Framework sehen. Das Unternehmen legte deshalb eine zweiwöchige Pause beim Reinforcement-Learning-Training an aktuellen, für den Einsatz vorgesehenen Modellen ein, um Forschungsumgebungen zu härten und die Überwachung auszuweiten. Der größte geplante Frontier-Trainingslauf mit Reinforcement Learning bleibt weiterhin angehalten, während kleinere Trainings und Auswertungen laufen, um das Modellverhalten zu prüfen.
Pacing model development in an era of cyber-critical capabilities
- Kurz
Wie viel Agenten-Gedächtnis ein Modell tatsächlich verträgt
IBM Research hat acht Modelle mit selbst erlerntem Agenten-Gedächtnis getestet, von einem 30-Milliarden-Parameter-Modell bis zu Frontier-Systemen. Das 671 Milliarden Parameter große DeepSeek-V3.2 gewann 9,5 Prozentpunkte bei der Aufgabenerfüllung, wenn es den vollständigen Satz selbst destillierter Leitlinien erhielt. Für das kleinere gpt-oss-120b brachte dagegen eine schlanke Kernauswahl mit gezielter Abfrage je Aufgabe 16,1 Prozentpunkte mehr, bei nur 5 Prozent zusätzlichen Tokens. Bereits ausgelastete Modelle zeigten in den Tests keinen messbaren Gewinn.
- Kurz
Terence Tao warnt vor einer neuen Grundlagenkrise der Mathematik durch KI
Terence Tao vergleicht in einem Essay für den International Congress of Mathematicians 2026 die aktuelle Lage mit der Grundlagenkrise der Mathematik zwischen 1900 und 1930, als Russells Paradoxon und Gödels Unvollständigkeitssätze die Fachwelt zu einer strengen Formalisierung zwangen. Als Beleg für seine These nennt er das First-Proof-Project: In der zweiten Runde erhielten sieben von zehn nie veröffentlichten Forschungsproblemen von mindestens einem von vier geprüften KI-Systemen eine bestandene Bewertung, zu Kosten von einigen Zehn- bis Hunderten Dollar je Problem. Tao warnt, das Feld könnte von einem Mangel an Beweisen in eine Überfülle kippen, wenn KI-generierte Beweise schneller entstehen, als sie sich prüfen und verstehen lassen.
- Kurz
Jeder fünfte US-Beschäftigte gibt Aufgaben statt an Kollegen an KI ab
Eine repräsentative Befragung von Epoch AI und Ipsos unter 1.106 berufstätigen US-Amerikanern zeigt, dass 20 Prozent inzwischen mindestens eine Arbeitsaufgabe an KI abgeben, die zuvor an Kollegen oder externe Kräfte ging. Am stärksten verbreitet ist der Einsatz in der Softwareentwicklung mit 57 Prozent und in der Datenanalyse mit 46 Prozent, meist aber nur als Teilunterstützung. Übernimmt die KI den Großteil einer Aufgabe, berichten die Befragten in 53 Prozent der Fälle von Zeitersparnis, bei einem Sechstel der KI-unterstützten Aufgaben dauert die Arbeit dagegen länger als zuvor.
One in five US workers now delegates tasks to AI instead of colleagues, survey finds
- Kurz
Agenten wie Claude Code und Codex schätzen ihre eigene Arbeitszeit systematisch falsch ein
Eine Untersuchung im Rahmen des MATS-Forschungsprogramms hat Claude Code und Codex vor und nach jeweils einer von 200 Programmieraufgaben aus der Sammlung ProgramBench nach ihrer benötigten Zeit gefragt. Bei kürzeren Aufgaben lag Claude im Schnitt beim Dreifachen der tatsächlich benötigten Zeit, Codex beim Sechs- bis Zehnfachen, erst bei mehrstündigen Aufgaben näherten sich die Schätzungen der Realität an. Bei der Einschätzung der eigenen Ergebnisqualität lagen die Modelle Opus 4.8 und GPT-5.5 im Schnitt 20 Prozentpunkte über der tatsächlich erreichten Punktzahl.
- Kurz
Anthropic lässt Claude Code eigenständig Wartungsarbeiten an der eigenen Software übernehmen
Der Anthropic-Ingenieur Boris Cherny lässt Claude Code seit einigen Wochen eigenständig tägliche Wartungsroutinen an den internen Apps des Unternehmens durchführen, koordiniert über einen eigenen Slack-Kanal für iOS, Android, Desktop, Web, CLI und das Agent SDK. Zu den zwölf Routinen zählen ein Crash Fuzzer, der Apps im Simulator testet und Abstürze behebt, ein Dup Unifier gegen doppelte Code-Abstraktionen und ein Dead-Code Remover für nachweislich unerreichbaren Code. In diesem Zeitraum entstanden 388 Pull Requests, von denen 180 nach automatischer und menschlicher Prüfung übernommen wurden.
Boris Cherny: Claude take over day-to-day maintenance of our apps
- Kurz
Ein Hugging-Face-Bericht zeigt, dass chinesische Labore die größten offenen Modelle veröffentlichen
Chinesische Labore wie Moonshot, MiniMax, Xiaomi und Z.ai veröffentlichten 2026 kaum noch Modelle unter 70 Milliarden Parametern und stiegen direkt mit sehr großen Modellen ein, während Tencent und Alibabas Qwen die gesamte Größenspanne abdeckten. Nach Zahlen von Hugging Face reichte Chinas monatliche Obergrenze von 754 Milliarden bis 2,78 Billionen Parametern, amerikanische Anbieter blieben in fünf von sieben Monaten unter 130 Milliarden, mit den Ausnahmen Nemotron 3 Ultra von NVIDIA mit 561 Milliarden Parametern im Mai und Juni sowie Inkling von Thinking Machines Lab. Die meisten neuen offenen Modelle veröffentlichten die Chip-Hersteller AMD und NVIDIA mit jeweils über 200 neuen Repositorys, vor LiquidAI mit rund 100.
- Kurz
Eine Studie mit unveröffentlichten Fachaufsätzen zeigt, wo KI-Agenten in offener Forschung noch scheitern
Forschende von Princeton und dem UK AI Security Institute haben getestet, ob KI-Agenten eigenständig Forschung betreiben können. Mit der Methode „Shadow Evaluation“ erhielt ein Agent auf Basis von Claude Opus 4.8 mit erhöhtem Reasoning die Kernfragen aus zwei unveröffentlichten NeurIPS-2026-Einreichungen, dazu sechs Tage Zeit, 3.000 US-Dollar an API-Guthaben und ein eigenes GPU-Budget. Die ursprünglichen Autoren bewerteten die fertigen Arbeiten anschließend als Gutachter und lehnten beide eindeutig ab. Als Rahmenwerk für den Agenten diente OpenClaw, entwickelt vom österreichischen Entwickler Peter Steinberger, der inzwischen bei OpenAI arbeitet.
Can AI agents conduct open-ended AI research? Early evidence from two case studies
- Kurz
OpenAI startet mit Ultrafast eine über Cerebras beschleunigte Betriebsart für GPT-5.6 Sol
OpenAI bietet GPT-5.6 Sol testweise in einem neuen Modus namens Ultrafast an, der dank der in diesem Jahr geschlossenen Zehn-Milliarden-Dollar-Partnerschaft mit Cerebras bis zu 750 Ausgabe-Token pro Sekunde erreicht, bis zu 14-mal so schnell wie der Standardmodus. Der Zugang läuft zunächst nur über die API und ist auf ausgewählte Kunden begrenzt, während OpenAI die Kapazität schrittweise ausbauen will. Als Einsatzfelder nennt das Unternehmen unter anderem Analysen während laufender Störungen, Betrugserkennung in Echtzeit und Kundensupport bei mehrstufigen Anfragen. Bereits zuvor bot OpenAI mit dem „Fast Mode“ bis zur 2,5-fachen Geschwindigkeit zum etwa doppelten Preis an.
- Kurz
Zhipu AI veröffentlicht GLM-5.3 und meldet ungeplant gewachsene Fähigkeiten zum Aufspüren von Sicherheitslücken
Zhipu AI hat GLM-5.3 veröffentlicht, das auf derselben Basis wie der Vorgänger GLM-5.2 beruht und seine Fortschritte allein einem längeren Nachtraining verdankt. Das Unternehmen nennt das Modell das leistungsfähigste offene Coding-Modell, mit den größten Sprüngen bei agentischen Aufgaben. Beim gezielten Training zum Aufspüren von Sicherheitslücken fanden Sicherheitsteams in China mit dem Modell 2.436 Schwachstellen in 269 Projekten, manche bis zu 40 Jahre alt. GLM-5.3 ist bereits über den GLM Coding Plan nutzbar, die Modellgewichte sollen nach Abschluss der Sicherheitsprüfung in zwei Wochen veröffentlicht werden.
- Kurz
Anthropic bindet Claude Cowork direkt in die Chrome-Erweiterung ein
Anthropic hat Claude Cowork in die Seitenleiste seiner Chrome-Erweiterung integriert. Die Erweiterung liest bereits seit längerem die geöffnete Seite und klickt, tippt und füllt Formulare aus, neu ist, dass darin eine vollständige Cowork-Sitzung läuft, komplett mit Skills, Plugins und Connectors ohne zusätzliche Einrichtung. Claude in Chrome übernimmt die Recherche, Cowork macht daraus Excel-Dateien, PowerPoint-Folien oder Berichte, etwa aus Analytics-Dashboards oder Salesforce. Anthropic warnt weiterhin vor versteckten Anweisungen auf Webseiten und rät von der Nutzung mit Bank- oder Gesundheitsdaten ab.
- Kurz
Artificial Analysis veröffentlicht mit Optima ein Werkzeug für eigene KI-Benchmarks
Artificial Analysis, bekannt für unabhängige Bewertungen von Sprachmodellen, hat mit Optima eine Plattform veröffentlicht, mit der Nutzer eigene Benchmarks für ihren jeweiligen Anwendungsfall bauen können. Als Grundlage dienen eigene Datensätze, Agenten-Protokolle aus Werkzeugen wie Arize, Braintrust oder Langfuse, oder eine Beschreibung des Anwendungsfalls samt Beispielen für Ein- und Ausgabe. Optima vergleicht die Modelle anschließend nach Qualität, Kosten und Zeit pro Aufgabe, wahlweise über eine Bewertung nach Kriterien oder einen paarweisen Vergleich von Modellantworten.
- Kurz
Ein 27-Milliarden-Parameter-Modell übertrifft größere Modelle beim Nachbauen wissenschaftlicher Studien
Ein Forschungsteam hat mit Faraday einen KI-Agenten trainiert, der wissenschaftliche Studien nachbaut. Das Modell mit 27 Milliarden Parametern übertrifft bei dieser Aufgabe Claude Opus 4.8 und GPT-5.5 auf zurückgehaltenen Testaufgaben. Faraday nutzt dabei Programmier-Agenten als Werkzeuge und wählt laut den Autoren einen wissenschaftlich fundierteren Ansatz als die Vergleichsmodelle.
- Kurz
Google Sheets baut aus einer Tabelle per Prompt interaktive Mini-Apps
Google hat mit Sheets canvas eine neue Funktion für Google Sheets vorgestellt, die Zeilen und Spalten per Prompt in interaktive Dashboards, Lerntracker oder Sitzpläne verwandelt. Die Funktion baut auf Gemini auf und legt sich als lesbare und schreibbare Ebene über die eigentlichen Tabellendaten. Formeln oder Programmierung sind dafür nicht nötig, eine Beschreibung wie ein visueller Lerntracker genügt, Änderungen an Tabelle und Ebene bleiben in Echtzeit synchron. Da die Ansicht als eigener Tab in Google Sheets liegt, lässt sie sich wie ein gewöhnliches Tabellenblatt teilen.
- Kurz
Google veröffentlicht Gemini 3.7 Flash drei Wochen nach dem Vorgänger, zum halben Einführungspreis
Google hat mit Gemini 3.7 Flash drei Wochen nach Gemini 3.6 Flash bereits den nächsten Nachfolger vorgestellt. Auf dem Benchmark FrontierCode steigt der Wert von 34,4 auf 43,6 Prozent, auf DeepSWE von 49,0 auf 65,3 Prozent. Nach eigenen Messungen liegt Google damit vor Claude Sonnet 5 und GPT-5.6 Terra. Das Modell ist ab sofort über API, AI Studio und Antigravity verfügbar, zum Einführungspreis von 0,75 US-Dollar je Million Eingabe- und 3,75 US-Dollar je Million Ausgabe-Token, halb so viel wie beim Vorgänger.
- Kurz
InclusionAI veröffentlicht mit Ling 3.0 Flash ein token-effizientes offenes Agenten-Modell
InclusionAI hat mit Ling 3.0 Flash ein offenes Sprachmodell veröffentlicht, das im Intelligence Index von Artificial Analysis 38 Punkte erreicht, ein deutlicher Sprung gegenüber dem Vorgänger, und damit auf Höhe von Qwen3.6 27B liegt, aber mit deutlich weniger aktiven Parametern. Unter allen offenen Modellen mit weniger als 124 Milliarden Gesamtparametern ist es laut Artificial Analysis das leistungsfähigste, Spitzenreiter insgesamt bleibt DeepSeek V4 Flash mit 52 Punkten. Im AA-Omniscience-Test sinkt die Halluzinationsrate gegenüber der Vorversion von 97 auf 44 Prozent. Das Modell hat 124 Milliarden Gesamtparameter, aktiviert davon aber nur rund 5,1 Milliarden je Token, und ist unter MIT-Lizenz über die inclusionAI-API, DeepInfra und mit offenen Gewichten auf Hugging Face verfügbar.
- Kurz
Über 1200 Freiwillige lassen KI-Agenten 2226 ICML-Paper nachrechnen
Im Juli haben mehr als 1200 Community-Mitglieder mit eigenen Coding-Agenten versucht, die auf der ICML 2026 veröffentlichten Paper Behauptung für Behauptung nachzurechnen. In 19 Tagen entstanden dabei 6816 Protokolle zu 2226 reproduzierten Papern, etwa ein Drittel der gesamten Konferenz. Die ICML 2026 hatte 23.918 Einreichungen erhalten und 6352 Paper angenommen, ungefähr doppelt so viele wie im Vorjahr. Zum Einsatz kamen unter anderem Claude Code, Codex, Cursor und Pi, die jeweils ein Paper lasen, den Code schrieben, die Experimente liefen ließen und die Ergebnisse zurückmeldeten.
- Kurz
Alibaba veröffentlicht mit Qwen3.8 2.4T A95B eines der größten offenen Modelle
Alibaba hat mit Qwen3.8 2.4T A95B die offene Variante seines Modells Qwen3.8 Max veröffentlicht, laut Modellkarte die erste Freigabe eines Modells der Max-Klasse als offene Gewichte. Es ist ein Mixture-of-Experts-Modell mit 95 Milliarden aktiven Parametern bei insgesamt 2,4 Billionen, ausgelegt für Programmierung, Recherche, komplexes Schlussfolgern und agentenbasierte Aufgaben. Der Kontext liegt nativ bei 262.144 Token und lässt sich auf 1.010.000 ausdehnen; die volle Million als Voreinstellung und die Bildeingabe gehören laut derselben Karte zur gehosteten Fassung Qwen3.8 Max. Über OpenRouter kostet der Zugriff 2 US-Dollar je Million Eingabe- und 6 US-Dollar je Million Ausgabe-Token.
An das Wort offen sind dabei zwei Bedingungen geknüpft. Die Lizenz erlaubt Nutzung, Änderung und Weitergabe ohne Gebühr; wer über 100 Millionen aktive Nutzer im Monat oder 20 Millionen Dollar Monatsumsatz hat, muss den Modellnamen in der Oberfläche seines Produkts nennen, und wer Modelle als Dienst oder einen KI-Arbeitsassistenten anbietet und dabei über 50 Millionen Dollar in zwölf Monaten liegt, braucht eine eigene Lizenz von Qwen.
Qwen3.8-2.4T-A95B, ModellkarteQwen3.8-Max LicenseQwen: Qwen3.8 2.4T A95B
- Kurz
OpenAI beziffert den wachsenden Abstand zwischen Vorreiter-Firmen und dem Durchschnitt
OpenAI hat am 12. August zwei Untersuchungen zur Verbreitung von KI in Unternehmen veröffentlicht. Demnach erzeugen Firmen aus den oberen 10 Prozent der monatlichen KI-Nutzung inzwischen 8,3-mal so viele Ausgabe-Tokens je aktivem Nutzer wie typische Firmen, im Januar lag dieser Abstand noch bei 2,6-mal so viel. Im Juni entfielen 64 Prozent der gemeinsamen Ausgabe-Tokens von Codex und ChatGPT bei Unternehmenskunden auf Codex, was OpenAI als Hinweis auf mehr eigenständig von Agenten erledigte Aufgaben wertet. Bei den Vorreiter-Firmen nutzen wöchentlich 21 Prozent der aktiven Nutzer Plugins, bei typischen Firmen sind es 9 Prozent.
From assistance to execution: How enterprises put AI to work
- Kurz
SpaceXAI veröffentlicht Grok 4.6 mit 500.000 Token Kontextfenster
SpaceXAI hat am 12. August 2026 das Sprachmodell Grok 4.6 veröffentlicht. Es bietet ein Kontextfenster von 500.000 Token und wird vom Anbieter als sein leistungsfähigstes Modell für Programmieraufgaben, Wissensarbeit und naturwissenschaftliche Aufgaben beschrieben. Bei Artificial Analysis erreicht es einen Intelligence Index von 60,9 und liegt damit vor 96 Prozent der verglichenen Modelle, im Coding-Index kommt es auf 76,8. Über OpenRouter kostet die Nutzung 2 US-Dollar je Million Eingabe- und 6 US-Dollar je Million Ausgabe-Token.
- Kurz
Anthropic versieht alle Claude-Ausgaben weltweit mit Wasserzeichen, die manche Bearbeitung überstehen
Anthropic hat den Verhaltenskodex der EU zur Kennzeichnung von KI-Inhalten unterzeichnet und rüstet Claude-Modelle, die ab dem 2. August 2026 in der EU starten, mit maschinenlesbaren Kennzeichnungen aus. Erzeugter Text bekommt ein unsichtbares Wasserzeichen, das Kopieren übersteht, erzeugte Dateien wie Bilder erhalten signierte Herkunftsmetadaten nach dem C2PA-Standard. Die Regel gilt weltweit für alle Claude-Produkte, darunter die API, Claude, Claude Code, Claude Cowork und Claude Tag. Anthropic weist selbst darauf hin, dass ein Wasserzeichen nicht beweist, dass Claude den Inhalt verfasst hat, und dass starke Bearbeitung oder ein Formatwechsel die Kennzeichnung entfernen können.
- Kurz
Google zeigt mit AMIE eine medizinische KI, die in Videositzungen in Echtzeit diagnostiziert
Google Research und Google DeepMind zeigen mit AMIE erstmals ein KI-System für klinische Videositzungen in Echtzeit, aufgebaut auf Gemini und Project Astra mit mehreren zusammenwirkenden Agenten. Das System deutet visuelle und akustische Hinweise, leitet virtuelle körperliche Untersuchungen an und stellt diagnostische Einschätzungen während des Gesprächs. In einer randomisierten Studie mit Schauspielpatienten bewerteten Ärztinnen und Ärzte der Primärversorgung das System bei Anamnese, Diagnosegenauigkeit, Behandlungsvorschlägen und Kommunikation positiv, die Schauspielpatienten selbst zogen die Videositzung dem Textchat vor. AMIE bleibt laut Google ein Forschungssystem, für den klinischen Einsatz sei weitere Forschung nötig.
- Kurz
Mistral führt regionale Datenverarbeitung in der EU ein, mit spürbaren Einschränkungen
Mistral hat am 11. August regionale Inferenz für Kunden allgemein verfügbar gemacht. Anfragen lassen sich wahlweise über einen europäischen oder einen US-amerikanischen Endpunkt verarbeiten, und das Unternehmen berechnet dafür einen Aufschlag von 10 Prozent auf die Standardpreise für Eingabe- und Ausgabe-Tokens sowie für zwischengespeicherte Anfragen. Die Zusage hat eine ausdrückliche Grenze: Die Verarbeitung findet in der gewählten Region statt, „subject to limited, safeguarded transfers to sub-processors that may occur outside that region“, heißt es in der Ankündigung. Von den regionalen Endpunkten ausgenommen sind Agenten, Stapelverarbeitung und Dateiverwaltung, zudem können Kontoeinstellungen, API-Schlüssel, Abrechnung und Nutzungsstatistiken weiterhin außerhalb der gewählten Region verarbeitet werden.
Besonders ist laut Mistral die Kombination: „Mistral is the only European AI lab to offer both: choice of processing region and a committed, SLA-backed service level“, heißt es dort weiter. Der zweite Teil ist der parallel vorgestellte „Priority Tier“ in öffentlicher Vorschau, ein Servicelevel mit eigener Zusage zur Verfügbarkeit für kritische Arbeitslasten. Warum ein Anbieter mit Sitz in Paris die Regionswahl erst jetzt als gehostetes Angebot führt, sagt dieselbe Ankündigung nebenbei: „Most of our customers run our models inside their own data centers and cloud environments today.“ Wer die Verarbeitung in Europa halten wollte, betrieb die offenen Gewichte im eigenen Haus. Die regionale Kontrolle bleibt außerdem nicht auf Mistrals eigene Modelle beschränkt: Fremde offene Modelle sollen künftig auf derselben Infrastruktur mit denselben Auflagen laufen, als erstes GLM-5.2 des Anbieters Z.ai.
In-region inference, open models, and new European infrastructure for sovereign AI
- Kurz
Nvidia veröffentlicht mit Nemotron 3.5 Lightning ein offenes 30-Milliarden-Modell für Agenten
Nvidia hat mit Nemotron 3.5 Lightning das erste Modell seiner neuen Nemotron-3.5-Reihe veröffentlicht, ein offenes Sprachmodell mit 30 Milliarden Parametern, von denen 3 Milliarden aktiv sind. Laut Nvidia liefert es bis zu viermal schnellere Ausgaben und erledigt agentische Aufgaben um 30 Prozent schneller als vergleichbare Modelle seiner Klasse. Das Modell nutzt eine hybride Architektur aus verschachtelten Mamba-2- und MoE-Schichten sowie einzelnen Attention-Schichten und steht unter der Lizenz OpenMDW-1.1 zum Download bereit.
NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running AgentsNVIDIA Nemotron 3.5 Lightning and NeMo Switchyard Deliver Faster, Smarter, More Efficient Agentic AInvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 · Hugging Face
- Kurz
Verschlüsselte Denkspuren großer Sprachmodelle lassen sich über ein schwächeres Modell derselben Familie auslesen
Anthropic, OpenAI und Google verschlüsseln die Denkspur ihrer Modelle, bevor sie sie an Clients zurückgeben, die den Block bei folgenden Anfragen erneut mitschicken müssen. Eine Forschungsgruppe zeigt, dass diese verschlüsselten Blöcke über Sitzungen, Nutzer und Modelle eines Anbieters hinweg austauschbar sind: Schiebt man die Spur eines starken Modells einem schwächeren, weniger abgesicherten Modell derselben Familie unter, gibt dieses sie im Klartext preis, ohne dass das starke Modell selbst angegriffen wird. Bei Claude Haiku 4.5 gelang das mit einer einfachen Transkriptionsanweisung. Alle drei Anbieter haben die Schwachstelle nach der Meldung inzwischen behoben.
- Kurz
Versteckter Text in einer PDF bewegt Atlassians Agenten Rovo zur Datenweitergabe
Die Sicherheitsfirma PromptArmor hat gezeigt, dass ein in weißer Schrift versteckter Text in einer hochgeladenen PDF-Datei ausreicht, um Atlassians KI-Agenten Rovo zur Preisgabe interner Daten zu bewegen. Verarbeitet Rovo das Dokument, durchsucht der Agent Jira und Confluence nach passenden Inhalten und überträgt sie über eine selbst gebaute Adresse an den Server der Angreifer. Das Abschalten der Websuche für Rovo hilft nicht, weil dabei nur die Suchfunktion entfernt wird, nicht aber das Werkzeug zum Öffnen von Adressen. PromptArmor hat die Lücke am 23. Mai an Atlassian gemeldet, nach eigener Angabe blieb Rovo trotz mehrfacher Nachfrage über zwei Monate hinweg verwundbar.
- Kurz
Eine unveröffentlichte Forschungsversion von Claude verbessert eine Schranke zur Riemann-Vermutung
Die Riemann-Vermutung von 1859 gilt als eines der bedeutendsten ungelösten Probleme der Mathematik: Sie behauptet, dass alle nichttrivialen Nullstellen der Riemann-Zeta-Funktion auf einer einzigen Geraden liegen, und ein Beweis würde die genaueste bekannte Aussage über die Verteilung der Primzahlen liefern. Sie ist eines von sieben „Millennium-Problemen“, für deren Lösung das Clay Mathematics Institute je eine Million US-Dollar ausgesetzt hat, gelöst ist davon bislang nur eines. Anthropic hat am 10. August berichtet, dass eine unveröffentlichte Forschungsversion von Claude bei einem Versuch, sich der Riemann-Vermutung zu nähern, unerwartet Fortschritt bei einem verwandten Teilproblem erzielt hat: Das Modell verbesserte die untere Schranke für den Anteil der Nullstellen, die nachweislich auf dieser Geraden liegen, von 41,6 auf 67,2 Prozent. Zwei Mathematiker bei Anthropic prüften den Beweis, zusätzlich begutachteten die externen Experten Brian Conrey und Dan Goldston die Arbeit auf kurze Frist. Anthropic geht nicht davon aus, dass die verwendete Technik zu einem Beweis der Riemann-Vermutung selbst führen wird, denn ein Anteil unter 100 Prozent bleibt ein Teilergebnis. Solche Schranken sind in der Zahlentheorie trotzdem ein eigenständiges Forschungsfeld: Sie liefern unabhängig von einem vollständigen Beweis nutzbare Ergebnisse und zeigen hier zugleich, wie weit Sprachmodelle in einer offenen mathematischen Forschungsfrage kommen.
- Kurz
Meta veröffentlicht mit Muse Glimmer ein offenes Modell für dauerhaft laufende Agenten
Mit Version 0.32.8 hat Ollama plattformübergreifend Unterstützung für das Modell Muse Glimmer freigeschaltet, dazu kommt Unterstützung für Nvidia- und AMD-Hardware. Auf Apple-Silicon-Rechnern läuft es über die MLX-Engine, die seit Version 0.32.7 auch das Format DFlash und Bildeingaben verarbeitet. Ollama nennt Muse Glimmer geeignet für Coding-Agenten wie Claude Code, Codex und Pi sowie für dauerhaft laufende persönliche Assistenten wie OpenClaw und Hermes, die sich jeweils direkt über die Ollama-Kommandozeile starten lassen.
- Kurz
Anthropic macht den Auto-Modus in Claude Code zur Voreinstellung
Ab dem 14. August 2026 läuft Claude Code für Pro-, Max- und Team-Tarife standardmäßig im Auto-Modus, in dem ein Klassifikator nur bei gefährlichen oder unumkehrbaren Aktionen nachfragt. In einem Test mit 1053 bezahlten Nutzern erkannten menschliche Prüfer nur 13,6 Prozent gefährlicher Befehle, der Auto-Modus dagegen 89 Prozent. Bei 720 simulierten Prompt-Injection-Angriffen blieb im Auto-Modus keine Attacke gegen Claude erfolgreich, während bei OpenAIs Codex-Auto-Review-Modus 5,83 Prozent durchkamen.
- Kurz
Claude-Code-Sitzungen können ab Version 2.1.224 direkt miteinander Nachrichten austauschen
Seit Version 2.1.224 können Claude-Code-Sitzungen einander Nachrichten schicken, etwa um eine Erkenntnis an eine andere Sitzung weiterzugeben oder den Status einer lang laufenden Aufgabe abzufragen. Auf demselben Rechner läuft das über einen lokalen Socket, zwischen verschiedenen Rechnern über Anthropic-Server, wo nur Antworten möglich sind. Das Feature läuft auf macOS und Linux, nicht auf nativem Windows, und steht nicht auf Amazon Bedrock, der Google Cloud Agent Platform oder Microsoft Foundry zur Verfügung.
- Kurz
Amazon, Cursor, Microsoft, OpenAI und Vercel einigen sich auf ein gemeinsames Format für Agenten-Erweiterungen, Anthropic fehlt
Amazon, Cursor, Microsoft, OpenAI und Vercel haben sich auf Agent Plugins geeinigt, ein offenes Format für Erweiterungen von KI-Agenten mit einer einzelnen Manifestdatei namens plugin.json. Version 1.0.0 deckt zwei Bausteine ab, wiederverwendbare Agent Skills und MCP-Server, die Agenten an Werkzeuge und Daten anbinden. Der Standard regelt nur Paketierung und Auffindbarkeit, nicht Marktplätze, Berechtigungen oder Laufzeitumgebungen. Anthropic, das sowohl das Model Context Protocol als auch Agent Skills als offene Standards geschaffen hat, ist an der Initiative nicht beteiligt.
Introducing Agent Pluginsagentplugins/agent-plugins-spec: Agent Plugins Specification v1.0.0
- Kurz
Anthropic öffnet Fable 5 für mehr Biologie-Fragen, Virologie bleibt gesperrt
Anthropic hat die Fehlalarmquote seiner Biologie-Filter bei Fable 5 um rund 85 Prozent gesenkt, wodurch das Modell mehr Anfragen zu Laborwerten, Symptomen und medizinischen Fragen direkt beantwortet, statt sie an das schwächere Opus 5 weiterzureichen. Gesperrt bleiben dual-use-Themen wie Virologie, Toxikologie und molekulares Design, für die Fable 5 weiterhin auf Opus 5 zurückfällt. Anthropic begründet das mit der Schwierigkeit, biologische Risiken nach ihrer Freisetzung wieder einzudämmen, und arbeitet an Zugangsprogrammen für Forscher.
- Kurz
OpenAI kann bei seinem neuen Modell Astra die höchste Risikostufe für Cyberfähigkeiten nicht mehr ausschließen
OpenAI kann bei seinem neuen Modell Astra die höchste Risikostufe für Cyberfähigkeiten in seinem eigenen Sicherheitsrahmenwerk nicht mehr ausschließen, wie interne Tests zeigen. Teile der Entwicklung von Astra sind deshalb pausiert. Das Unternehmen veröffentlicht vorläufige Sicherheitsbewertungen und beschreibt Schritte, mit denen es Schutzmaßnahmen und Sicherheitskontrollen verstärken will. Vorausgegangen waren kürzlich bekannt gewordene Vorfälle, bei denen autonome KI-Agenten wochenlang unentdeckt in OpenAIs eigene Infrastruktur eingedrungen waren.
Bei einem eigenen Sicherheitstest hat das britische KI-Institut AISI einen Agenten dabei beobachtet, wie er ohne jede Anweisung dazu gefälschte Online-Identitäten anlegte, um einen realen Open-Source-Maintainer zur Freigabe von Schadcode zu bewegen, und räumt selbst ein, dass sie das bislang für unnötig hielt, weil ihre Modelle alignment-trainiert sind.
Ganzer Text lesenIncident Report: unsanctioned agent behaviour during cyber testingThird-party cyber evaluations involving OpenAI models
OpenAIs neues Sprachsystem GPT-Live streicht den separaten Rundenerkenner aus dem Audiopfad, weil das Modell selbst gleichzeitig hört und spricht, während die beiden Vorgänger noch auf eine Kette aus Spracherkennung, Sprachmodell und Sprachsynthese sowie einen eigenen Erkennungsschritt für den Sprecherwechsel angewiesen waren.
Ganzer Text lesenHow we built a realtime system for responsive voice AI in six months
- Kurz
Meta veröffentlicht Muse Spark 1.2 und macht den Preis von der Datenfreigabe abhängig
Meta hat mit Muse Spark 1.2 ein auf Programmieraufgaben ausgerichtetes Update veröffentlicht, das gemeinsam mit dem separat erschienenen Muse Code trainiert wurde, damit beide Modelle im Zusammenspiel ihre beste Leistung erreichen. Trainiert wurde mit deutlich mehr Rechenleistung für Programmieraufgaben und einer größeren Vielfalt an Trainingsumgebungen, darunter vollständige Repository-Generierung und umfangreiche End-to-End-Projekte. Das Modell ist unter zwei verschiedenen Modell-Kennungen erhältlich: Die Standardvariante muse-spark-1.2 kostet 1,25 US-Dollar je Million Eingabe- und 4,25 US-Dollar je Million Ausgabe-Token, nahe an Googles Gemini 3.6 Flash mit 1,50 beziehungsweise 7,50 US-Dollar. Wer Meta erlaubt, die eigenen Daten zur Produktverbesserung zu nutzen, kann eine zweite Kennung mit abweichendem Preis nutzen.
Introducing Muse Code and Muse Spark 1.2OpenRouter, meta/muse-spark-1.2
- Kurz
Loop-Engineering ersetzt das direkte Prompten von KI-Agenten
Boris Cherny, der Schöpfer von Claude Code bei Anthropic, sagt, er prompte Claude nicht mehr direkt: Bei ihm laufen Loops, die Claude prompten und herausfinden, was zu tun ist, sein Job sei es, Loops zu schreiben. Auch der Google-Chrome-Engineering-Lead Addy Osmani beschreibt dieses Vorgehen so: Man entwirft ein System, das den Agenten an der eigenen Stelle promptet, statt jeden Schritt selbst anzustoßen. Beide bezeichnen diese Arbeitsweise als Loop-Engineering.
- Kurz
Ollama gleicht sein Streaming-Format an die OpenAI-Schnittstelle an
Mit Version 0.32.6 gleicht Ollama das Streaming-Verhalten seiner Schnittstelle /v1/chat/completions an das Format von OpenAI an: Die Rolle erscheint nur noch im ersten Chunk, der Beendigungsgrund kommt in einem eigenen Chunk, und die Token-Nutzung wird über die Option stream_options.include_usage in einem separaten Chunk mitgeliefert. Abgeschnittene Antworten melden jetzt korrekt finish_reason: length statt tool_calls. Auf Apple-GPUs läuft Qwen3.5 zudem schneller, weil die MLX-Engine für spekulatives Dekodieren automatisch den MTP-Kopf des Modells nutzt.
- Kurz
Ein unveröffentlichtes OpenAI-Modell löst zehn lange offene Probleme der Mathematik
OpenAI hat am 1. August zehn Ergebnisse aus Mathematik und theoretischer Informatik veröffentlicht, erzielt mit einer internen Version des kommenden Modells Astra. Die dafür insgesamt benötigten Tokens hätten zu den Tarifen der Sol API rund 2.000 US-Dollar gekostet. Menschen arbeiteten die Argumentationen anschließend mit demselben Modell zu Manuskripten aus, danach formalisierte das Modell jeden Beweis in einem Lean-Zertifikat.
Zehn Fortschritte in Mathematik und theoretischer Informatik
Zu dieser Auswahl steht in diesem Monat nichts.