Verstärkendes Lernen
Aktuelle Links, Zusammenfassungen und Marktinformationen zu Verstärkendes Lernen innerhalb von Training auf JetztStarten.de.
Einordnung
Dieses Cluster bündelt aktuelle Links, Zusammenfassungen und Marktinformationen zu einem klar abgegrenzten Thema.
Rubrik: KI Modelle & Architekturen
Unterrubrik: Training
Cluster: Verstärkendes Lernen
Einträge: 5
人大高瓴、IQuest团队联手,把OpenClaw、Claude Code接进RL训练中
Die Forschungsgruppe der Renmin-Universität und des Zhizhi Innovation Research Institute hat ein neues Rahmenwerk für verstärkendes Lernen namens ClawGym II entwickelt, das sich auf komplexe Agenten-Harnesses konzentriert. Dieses System ermöglicht es Agenten, unabhängig von externen Modellen und Offline-Daten in realen Interaktionsumgebungen kontinuierlich zu lernen und ihre Fähigkeiten zu verbessern. ClawGym II integriert reale Agenten-Harnesses in den Lernprozess, ohne deren interne Implementierung zu verändern, was eine direkte Optimierung der Modelle ermöglicht. Experimente zeigen, dass die Kombination von OpenClaw und Claude Code die Fähigkeiten der Agenten stabil verbessert. Zudem kann durch die Nutzung von Rollouts aus verschiedenen Harnesses ein gemeinsames Strategie-Modell trainiert werden. Die Forschung hebt hervor, dass die Entkopplung von Ausführung und Optimierung in einem Sandbox-Umfeld die Stabilität und Effizienz des Trainings erhöht. Die Methode wurde auch auf komplexe Aufgaben wie JobBench und OfficeQA angewendet, was die Vielseitigkeit von ClawGym II unter Beweis stellt. Die Ergebnisse zeigen, dass Agenten nicht nur Aufgaben ausführen, sondern auch ihre Fähigkeiten kontinuierlich verbessern können.
Igor Babuschkin's River AI raises $1.1B to build personal agents
River AI, ein von Igor Babuschkin gegründetes Unternehmen, hat kürzlich 1,1 Milliarden Dollar an Finanzierung gesammelt, um leistungsstarke persönliche KI-Agenten zu entwickeln. Die Finanzierungsrunde wurde von General Catalyst und AMP PBC angeführt, mit strategischen Investitionen von NVIDIA und AMD Ventures. Die Mittel sollen dazu dienen, Entwicklern Werkzeuge zur Verfügung zu stellen, um benutzerdefinierte KI-Modelle zu trainieren. Die API von River AI ermöglicht es Unternehmen, komplexe Trainingsläufe für verstärkendes Lernen in nur 15 bis 20 Minuten durchzuführen, was signifikante Kosteneinsparungen im Vergleich zu geschlossenen Alternativen bietet. Babuschkin betont die Vision einer offenen, zugänglichen und erschwinglichen KI-Zukunft, die den Nutzern dient. Die Plattform vereinfacht die Modellverbesserung und -bereitstellung, indem sie die zugrunde liegende Infrastrukturkomplexität übernimmt. River AI zielt darauf ab, eine integrierte Lösung zu schaffen, die neue Hardware und Trainingsinfrastruktur für personalisierte KI umfasst, um individuelle Anpassungen für jeden Nutzer zu ermöglichen und die Kontrolle über KI-Modelle von Unternehmen auf Einzelpersonen zu übertragen.
DesignArena Raises $7.9M to Teach AI Models Human Taste
DesignArena hat kürzlich 7,9 Millionen Dollar in einer Finanzierungsrunde gesammelt, um seine Plattform zur menschlichen Bewertung auszubauen, die für KI-Labore entscheidend ist. Die Plattform bedient bereits 5,3 Millionen Nutzer weltweit und ermöglicht das Sammeln von subjektivem menschlichem Feedback, das für das Training von KI-Systemen unerlässlich ist. Anstatt ästhetische Präferenzen durch Regeln zu codifizieren, erfasst DesignArena Millionen von Vorlieben echter Menschen und integriert diese Daten in die Trainingspipelines. Dies fördert ein verstärkendes Lernen in subjektiven Bereichen ohne objektiv richtige Antworten. Die demografische und kulturelle Vielfalt der Nutzer verschafft DesignArena einen Wettbewerbsvorteil, da sie ein breites Spektrum an ästhetischen Urteilen widerspiegelt. Die Finanzierung wird auch genutzt, um in angrenzende Bereiche wie UI/UX-Bewertungen und subjektive Schreibstilbewertungen zu expandieren. Damit positioniert sich DesignArena als wichtige Infrastruktur für die nächste Generation von KI-Systemen, indem es menschliches Urteil in skalierbare Prozesse umwandelt.
TAI #210: GLM-5.2 Closes Most of the Open-Weight Gap in Ten Weeks
Das KI-Modell GLM-5.2 von Z. ai hat in nur zehn Wochen bemerkenswerte Fortschritte gemacht und schließt die Leistungsdifferenz zu führenden Modellen wie Claude und GPT. Mit einer Punktzahl von 51 auf dem Intelligence Index hat GLM-5.2 einen Anstieg von 11 Punkten im Vergleich zu seinem Vorgänger erzielt. Diese Verbesserungen sind das Ergebnis einer optimierten Architektur, längeren Kontexttrainings und einer effizienteren Nutzung von Rechenressourcen. Z. ai hat zudem neue Methoden wie kompaktes, verstärkendes Lernen eingeführt, die es dem Modell ermöglichen, aus längeren Aufgaben zu lernen, ohne alle Informationen dauerhaft speichern zu müssen. Trotz dieser Fortschritte bleibt GLM-5.2 auf multimodale Eingaben beschränkt, was die Komplexität und Kosten des Trainings verringert.
AI Could Democratize One of Tech's Most Valuable Resources
Nvidia hat sich als führender Anbieter von KI-Chips etabliert, sieht jedoch wachsenden Wettbewerb durch Startups wie Wafer. Dieses Unternehmen trainiert KI-Modelle, um Code zu optimieren und effizient auf verschiedenen Chips auszuführen, und nutzt Verstärkendes Lernen zur Verbesserung bestehender Codierungsmodelle. Wafer kooperiert mit Firmen wie AMD und Amazon, um deren Softwareleistung zu steigern. CEO Emilio Andere ist überzeugt, dass die KI-gesteuerte Optimierung Nvidias Dominanz herausfordern könnte, da viele neue Chips vergleichbare Leistungswerte bieten. Zudem entwickelt das Startup Ricursive Intelligence innovative Methoden zur Chipgestaltung mit KI, was es mehr Unternehmen ermöglichen könnte, eigene Chips zu entwerfen. Diese Fortschritte könnten die Programmierbarkeit und Effizienz von Chips revolutionieren und die Abhängigkeit von Nvidia verringern. Die Automatisierung im Chipdesign könnte zudem die Hardwareentwicklung beschleunigen und die gesamte Branche nachhaltig beeinflussen.
Verwandte Cluster
Weitere Themen innerhalb derselben Unterrubrik zur schnellen Navigation.