Der Fall Cognition und Devin zeigt Agenten, die Tests durchführen und Aufzeichnungen und Berichte liefern. Verstehen Sie, wie Sie Revisionen reduzieren können, ohne auf die menschliche Validierung zu verzichten.
Direkte Antwort
Cognition berichtete OpenAI am 11. September 2026, dass Devin mithilfe von GPT-6 Astra Software testet und Aufzeichnungen zusammen mit Berichten über abgeschlossene Scans und ungetestete Bereiche zurücksendet. Für Unternehmen ist der Übergang vom generierten Code zur beweisbegleiteten Arbeit der relevante Fortschritt; Dennoch kann der Agent nicht allein die Korrektheit, Sicherheit oder ausreichende Deckung beweisen.
Überprüfungsarbeiten zu Beweisänderungen
Eine Änderung, begleitet von Videos, Protokollen, ausgeführten Fällen und einer expliziten Liste dessen, was im Test ausgelassen wurde, ermöglicht es dem Ingenieur, das Verhalten zu überprüfen und nicht nur Codeunterschiede zu lesen. Dies reduziert die manuelle Suche, eliminiert jedoch nicht die Beurteilung.
Im Bericht müssen Grenzwerte angegeben werden
Beweise sind nützlich, wenn sie Aufschluss über Umgebung, Version, Daten, Schritte, erwartete Ergebnisse und Lücken geben. Ein isoliertes Video zeigt einen glücklichen Weg; weist keine Sicherheit, Zugänglichkeit, Parallelität, Wiederherstellung oder Kompatibilität nach.
Der korrigierende Agent muss ebenfalls angefochten werden
Wenn dasselbe System implementiert und validiert, besteht das Risiko, dass die Hypothese selbst bestätigt wird. Nutzen Sie unabhängige Tests, vor der Ausführung definierte Kriterien, die Überprüfung kritischer Fälle und die Validierung durch ein anderes System oder eine andere Person.
Kennzahlen für einen Business-Piloten
Messen Sie die Rate der ohne Nacharbeit angenommenen Aufgaben, die nach der Genehmigung festgestellten Mängel, die Kriterienabdeckung, die Überprüfungszeit, die Kosten pro Änderung und Vorfälle. Vergleichen Sie den aktuellen Prozess anhand einer repräsentativen Aufgabenbasis.
Nexus-Lesung
Der nächste Schritt für Unternehmensagenten besteht darin, überprüfbare Ergebnisse zu liefern. Bei nützlicher Autonomie geht es nicht darum, ohne Aufsicht zu handeln: Es geht darum, einen klaren Weg zu schaffen, damit die menschliche Aufsicht schneller und besser informiert ist.
FAQ
Kann ein Agent seinen eigenen Code genehmigen?
Es kann Kontrollen durchführen, wesentliche Änderungen bedürfen jedoch weiterhin unabhängiger Kriterien und einer risikogerechten Prüfung.
Beweist die Bildschirmaufzeichnung, dass das System funktioniert?
Es beweist nur das in diesem Szenario beobachtete Verhalten; Deckungs-, Sicherheits- und Ausfallfälle erfordern zusätzliche Nachweise.
Was ist der beste erste Anwendungsfall?
Kleine, reversible Änderungen mit objektiven Akzeptanzkriterien, isolierter Umgebung und reproduzierbaren Tests.
Wichtige Leitfäden, um tiefer in die Entscheidung einzutauchen
Diese redaktionelle Analyse wurde von Nexus anhand der unten aufgeführten offiziellen Quellen erstellt, die am 12. September 2026 konsultiert wurden. Der Text ist original und interpretiert praktische Implikationen für Unternehmen.
- OpenAI – Cognition hilft Devin, seine eigene Arbeit mit GPT-6 Astra zu testen: offizielles Gehäuse, Testbeispiele, Aufzeichnungen und angegebener Umfang.
- OpenAI – Der Weg zum GPT-6 Astra: offizieller Kontext zu Fähigkeiten und Bewertung des im Fall verwendeten Modells.
Von der Hauptquelle gemeldetes Datum: 11. September 2026.

