28. März 2026

#42 | Vom Prompt zum Partner – ETH-Forscher Sven Pfiffner über die Zukunft spezialisierter KI-Systeme

#42 | Vom Prompt zum Partner – ETH-Forscher Sven Pfiffner über die Zukunft spezialisierter KI-Systeme
AI und Gesellschaft – Wege in die neue Welt
#42 | Vom Prompt zum Partner – ETH-Forscher Sven Pfiffner über die Zukunft spezialisierter KI-Systeme

Moderator Christoph Soltmannowski spricht mit Sven Pfiffner von der ETH Zürich über eine stille Revolution: Moderne KI-Systeme arbeiten längst nicht mehr allein. Was das für Unternehmen, Interfaces und unsere Beziehung zur Maschine bedeutet.

Wer heute ChatGPT oder Claude nutzt, geht davon aus, mit einem einzigen Modell zu sprechen. Doch diese Vorstellung ist überholt. Sven Pfiffner, KI-Forscher am Computer Graphics Lab der ETH Zürich, erklärt: Die Zukunft gehört vernetzten Spezialisten – verschiedene Teilmodelle koordinieren sich, ähnlich wie Fachärzte in einem Krankenhaus. Der Nutzer wird dabei vom Prompter zum Orchestrator: Nicht mehr das Feintuning jeder Anweisung zählt, sondern die Fähigkeit zu kommunizieren, was man will. «Das unterscheidet sich immer weniger davon, wie ich es einem Teamkollegen erklären würde», so Pfiffner.

Vertrauen ist gut, Evaluierung ist besser

Mit wachsender Autonomie steigt die Frage nach Kontrolle. Da KI probabilistisch arbeitet, könne immer Unerwartetes entstehen, räumt Pfiffner ein. Entscheidend sei deshalb laufende qualitative Evaluierung – Interaktionen aufzeichnen, analysieren, nachjustieren. Dabei warnt er vor dem Unterschied zwischen Demo und Realität: Viele Hersteller zeigten nur kontrollierte Szenarien. «Nicht die eindrucksvollste Demo ist entscheidend, sondern die nachweisbare Qualität im realen Einsatz.»

Avatare: Faszination und Risiko

Je komplexer die Systeme im Hintergrund, desto einfacher muss die Oberfläche werden. Chatfenster seien langfristig nur ein Zwischenstadium, so Pfiffner. Er arbeitet an der ETH unter Dr. Rafael Wampfler an einem digitalen Einstein, der mit der Stimme des Physikers spricht und per Webcam auf sein Gegenüber reagiert. Doch je menschlicher die Maschine wirkt, desto höher das Risiko emotionaler Bindungen. OpenAI musste 2025 sein GPT-Modell zurückschrauben, nachdem Nutzer eine persönliche Abhängigkeit entwickelt hatten. Pfiffner sieht die Verantwortung bei den Herstellern: «Es muss klar kommuniziert werden – hier ist eine Maschine, kein Mensch.»

KI als Kollegin, nicht als Ersatz

Für die näheren Jahre sieht Pfiffner keine Massenentlassungen, wohl aber einen Wandel: Repetitive Aufgaben werden delegiert, Menschen gewinnen Raum für Kreativität und persönliche Erfahrung. «Alles, was eine KI schafft, ist eine Kombination aus allem, was sie gesehen hat. Beim Menschen stecken eigene Gefühle drin – und das wird man immer spüren.» Sein Rat: eine Intuition für KI-Systeme durch regelmässige Interaktion entwickeln, statt sich in technischen Details zu verlieren.

Vertrauen ist gut, Evaluierung ist besserAvatare: Faszination und RisikoKI als Kollegin, nicht als Ersatz.

1
00:00:17,140 --> 00:00:19,380
Sven Pfiffner herzlich
Willkommen zurück in unserem

2
00:00:19,380 --> 00:00:20,900
Podcast.
Du warst ja schon mal bei uns zu

3
00:00:20,900 --> 00:00:24,900
Gast.
Du Forschst an der ETH zum Thema

4
00:00:24,900 --> 00:00:29,700
künstliche Intelligenz, speziell
bezogen auf Grafiken heute.

5
00:00:30,340 --> 00:00:32,900
Du beschäftigst dich auch mit
der Frage, wie KI Systeme

6
00:00:32,900 --> 00:00:35,940
zusammenarbeiten, das ist heute
auch das Thema, also wenn ich

7
00:00:35,940 --> 00:00:39,020
heute JPT oder Cloud nutze,
spreche ich mit einem einzigen

8
00:00:39,020 --> 00:00:41,220
Modell.
Du sagst, dass sich das jetzt

9
00:00:41,220 --> 00:00:43,060
gerade grundlegend ändert,
warum?

10
00:00:43,680 --> 00:00:46,000
Ja, also zuerst mal danke für
die Einladung.

11
00:00:46,160 --> 00:00:51,120
Und ja, das ist tatsächlich so.
Wir haben die Situation, dass es

12
00:00:51,120 --> 00:00:57,120
bereits jetzt bei Herstellern
wie Open AI oder Entropic oder

13
00:00:57,120 --> 00:01:00,480
Google der Fall ist, dass wir
tatsächlich nicht mehr mit einem

14
00:01:00,480 --> 00:01:03,840
einzigen System kommunizieren,
sondern das geht bereits so in

15
00:01:03,840 --> 00:01:07,360
eine Richtung, wo mehrere
Systeme miteinander arbeiten, um

16
00:01:07,360 --> 00:01:11,440
bestimmte Aufgaben zu beenden.
Also es geht wirklich in diese

17
00:01:11,840 --> 00:01:15,520
Richtung.
Und das führt dann auch dazu,

18
00:01:15,520 --> 00:01:19,760
dass wenn wir einen Befehl
eingeben, das Ganze nicht mehr

19
00:01:19,760 --> 00:01:24,880
einfach zu einem Agenten geht,
sondern halt zu einer großen

20
00:01:24,880 --> 00:01:27,680
Menge an verschiedenen
spezialisierten Teilsystemen.

21
00:01:27,840 --> 00:01:29,760
Jetzt gibt gibt es eben dieses
Prinzip.

22
00:01:29,760 --> 00:01:33,200
Mixture of Experts, wie kannst
du das erklären, dass es auch

23
00:01:33,200 --> 00:01:35,280
nicht Techniker verstehen, worum
es da geht?

24
00:01:35,760 --> 00:01:38,960
Ja, also ich schreibe das immer
gerne mit einem.

25
00:01:39,440 --> 00:01:42,400
Aufenthalt im Krankenhaus wenn
ich ein Leiden habe und ins

26
00:01:42,400 --> 00:01:46,240
Krankenhaus gehe, dann will ich
ja auch nicht, dass eine Person

27
00:01:46,240 --> 00:01:48,440
alles macht.
Ich gehe erst mal dahin, dann

28
00:01:48,440 --> 00:01:51,760
lasse ich mich tranchieren und
dann gibt es, je nachdem was wie

29
00:01:51,760 --> 00:01:55,240
das Leiden ist, einen
Spezialisten für das Herz, einen

30
00:01:55,240 --> 00:01:58,720
Spezialisten für die Haut und so
weiter und sofort und bei Mix

31
00:01:58,720 --> 00:02:00,960
chave Experts läuft das
eigentlich ziemlich ähnlich,

32
00:02:00,960 --> 00:02:03,600
also es ist nicht mehr ein
Modell, das alles kann.

33
00:02:03,920 --> 00:02:06,560
Sondern es ist ein Zusammenspiel
aus vielen verschiedenen

34
00:02:06,560 --> 00:02:11,039
Modellen, die sich untereinander
koordinieren und am Anfang, wenn

35
00:02:11,039 --> 00:02:14,520
wir dem einen Befehl geben, dann
wird das an das entsprechende

36
00:02:14,520 --> 00:02:16,520
Expertenmodell weitergeleitet.
Eben.

37
00:02:16,520 --> 00:02:19,360
Man sagt ja sonst so viele Köche
verderben den Brei, das muss

38
00:02:19,360 --> 00:02:23,000
halt ja gesteuert werden,
welcher Experte oder vielleicht

39
00:02:23,000 --> 00:02:26,560
muss man auch sagen, welche
Expertin dann irgendwo zum zum

40
00:02:26,560 --> 00:02:30,000
Einsatz kommt, ja.
Ja, also es gibt da 2

41
00:02:30,000 --> 00:02:33,120
grundlegende Methodologien
einmal.

42
00:02:33,680 --> 00:02:40,640
Dass wir das vor dem Eingeben in
das Modell manuell steuern

43
00:02:40,640 --> 00:02:43,200
können.
Beispielsweise kann dann ein

44
00:02:43,200 --> 00:02:46,520
Experte ausgewählt werden.
Anhand von dem Abo Modell, das

45
00:02:46,520 --> 00:02:49,400
der Nutzer hat oder wieviel
Auslastung gerade der Server

46
00:02:49,400 --> 00:02:50,640
hat.
Dass dann ein stärkeres oder

47
00:02:50,640 --> 00:02:51,920
schwächeres Modell genommen
wird.

48
00:02:52,320 --> 00:02:54,800
Bei Mixed of Experts ist es aber
tatsächlich so, dass.

49
00:02:55,440 --> 00:02:58,360
Schlussendlich alle Experten in
einem Modell sind, also in einem

50
00:02:58,360 --> 00:03:01,360
Netzwerk, aber das ist dann
wieder da drauf, trainiert

51
00:03:01,360 --> 00:03:04,160
spezielle Teile zu aktivieren
oder deaktivieren, je nachdem

52
00:03:04,160 --> 00:03:06,880
was es braucht, wie beim
menschlichen Gehirn, wo ja nicht

53
00:03:06,880 --> 00:03:10,680
immer jedes jeder Gehirnbereich
aktiviert wird, sondern je

54
00:03:10,680 --> 00:03:13,480
nachdem, was gerade nötig ist,
aktiviert das Gehirn selber

55
00:03:13,480 --> 00:03:16,080
bestimmte Regionen und so ist
das eigentlich in einem Modell

56
00:03:16,080 --> 00:03:18,720
dann auch.
Ist es dann die Aufgabe des

57
00:03:18,720 --> 00:03:20,760
Menschen, das zu machen?
Also ich meine, bis jetzt hat

58
00:03:20,760 --> 00:03:23,200
man ja gepromptet und jetzt wird
man da mehr so zum.

59
00:03:23,760 --> 00:03:27,480
Orchestrator oder Organisator
quasi oder oder wie muss, wie

60
00:03:27,480 --> 00:03:29,280
muss man das verstehen oder
macht die Maschine das

61
00:03:29,280 --> 00:03:32,400
selbstständig?
Ja, also Promps sind immer noch

62
00:03:32,400 --> 00:03:35,520
wichtig in dem Sinn, dass man
dem Modell sagt, was man will.

63
00:03:35,520 --> 00:03:39,200
Also man muss klar definieren,
was möchte ich eigentlich und

64
00:03:39,200 --> 00:03:43,360
was soll dabei rauskommen, aber
klassisches prompt Engineering,

65
00:03:43,360 --> 00:03:47,080
wie wir es bis jetzt kennen, wo
man wirklich iterativ die

66
00:03:47,080 --> 00:03:49,840
Prompts besser machen muss und
auf jede Kleinigkeit achten.

67
00:03:50,160 --> 00:03:53,040
Das wird immer weniger, weil
halt das Modell durch diese

68
00:03:53,040 --> 00:03:58,080
Mixed Shift Expert Möglichkeiten
immer mehr lernt und besser

69
00:03:58,080 --> 00:04:01,520
darin wird selbst zu entscheiden
wie das es vorgeht.

70
00:04:02,560 --> 00:04:05,880
Das heißt, dass die ganze
Workflows übernimmt, statt nur

71
00:04:05,880 --> 00:04:08,400
einzelne Aufgaben.
Hast du ein Beispiel, wo das

72
00:04:08,400 --> 00:04:12,640
heute schon so funktioniert?
Ja, ein klassisches Beispiel ist

73
00:04:12,720 --> 00:04:15,200
Kundensupport.
Das ist ein.

74
00:04:15,520 --> 00:04:18,720
Relativ einfach machbares
Problem für eine KI, weil es

75
00:04:18,720 --> 00:04:21,279
klar definiert ist und es immer
ungefähr nach dem gleichen

76
00:04:21,279 --> 00:04:24,120
Schema abläuft.
Und da ist es mittlerweile schon

77
00:04:24,120 --> 00:04:27,600
so, dass wir Modelle haben
können, die sind fest an ein E

78
00:04:27,600 --> 00:04:30,000
Mail System oder ein
Telefonsystem angeschlossen.

79
00:04:30,400 --> 00:04:33,680
Und wenn eine Kundenanfrage
reinkommt, merkt der selber, in

80
00:04:33,680 --> 00:04:36,160
welche Richtung geht die
Anfrage, worum geht es dann,

81
00:04:36,160 --> 00:04:40,400
wird der entsprechende Experte
dazu geschalten und wenn das

82
00:04:40,400 --> 00:04:43,200
Modell merkt, dass es nicht
Auskunft geben kann oder nicht

83
00:04:43,200 --> 00:04:45,600
weiterhelfen kann, wird das
Ganze dann an einen Menschen

84
00:04:45,600 --> 00:04:48,080
weitergeleitet, also eigentlich
sehr automatisiert.

85
00:04:48,240 --> 00:04:51,680
Aber während das automatisiert
läuft, kann man diesem System

86
00:04:51,680 --> 00:04:55,440
dann vertrauen.
Oder anders gefragt, wer wie wie

87
00:04:55,440 --> 00:04:58,720
findet die Kontrolle statt, dass
das dann auch wirklich alles

88
00:04:58,720 --> 00:05:01,120
mit.
Mit rechten Dingen.

89
00:05:01,120 --> 00:05:06,000
Und zugeht, ja.
Es ist immer schwierig, bei KI

90
00:05:06,000 --> 00:05:09,360
von Kontrolle zu reden, weil
schlussendlich ist KI ja nichts

91
00:05:09,360 --> 00:05:12,280
anderes als ein
probabilistisches System.

92
00:05:12,280 --> 00:05:16,040
Das heißt, es arbeitet mit
Wahrscheinlichkeiten und bei

93
00:05:16,040 --> 00:05:18,680
diesen Wahrscheinlichkeiten kann
es halt immer auch sein, dass

94
00:05:18,680 --> 00:05:21,040
etwas rauskommt, was nicht gut
ist.

95
00:05:21,520 --> 00:05:24,480
Das ist in der Natur von von der
Architektur.

96
00:05:25,600 --> 00:05:29,960
Aber was man machen kann, ist
das Modell dann als geschlossene

97
00:05:29,960 --> 00:05:34,080
Blackbox betrachten und halt
laufend qualitativ evaluieren,

98
00:05:34,240 --> 00:05:37,040
wie dass das ganze funktioniert
mit Beispielen.

99
00:05:37,040 --> 00:05:40,400
Man kann vergangene
Interaktionen aufzeichnen und

100
00:05:40,400 --> 00:05:42,880
dann schauen, was hat gut
funktioniert, was hat nicht gut

101
00:05:42,880 --> 00:05:46,000
funktioniert und dann das Modell
entsprechend dazu bringen, mehr

102
00:05:46,000 --> 00:05:48,320
in die gute Richtung zu gehen
und es dann so halt laufend

103
00:05:48,320 --> 00:05:51,120
verbessern.
Also Blackbox heißt ja so quasi

104
00:05:51,120 --> 00:05:53,880
einfach gesagt, gibt ein Input,
gibt ein Output und dann schaut

105
00:05:53,880 --> 00:05:57,120
man, wie gut ist der Output.
Aber man muss ja dann vielleicht

106
00:05:57,120 --> 00:05:59,200
irgendwie.
Ja, vielleicht sind wir Menschen

107
00:05:59,200 --> 00:06:02,440
halt so kontrollfreaks,
irgendwie immer noch, wenn man

108
00:06:02,520 --> 00:06:05,200
dann, wenn dann irgendwas nicht
läuft, will man ja wissen, wo,

109
00:06:05,280 --> 00:06:08,800
wo ist der Fehler passiert und
wie genau, was ist da genau

110
00:06:08,800 --> 00:06:11,840
vonstatten gegangen.
Ja, es ist halt schwierig, weil

111
00:06:11,840 --> 00:06:16,280
gerade große KI Modelle
mittlerweile so viele Parameter

112
00:06:16,280 --> 00:06:19,840
haben und so viele Elemente, die
da mitspielen, dass.

113
00:06:20,240 --> 00:06:23,720
Eigentlich keiner mehr 100%
weiß, was funktioniert jetzt

114
00:06:23,720 --> 00:06:26,720
wirklich in welchem Schritt, in
welchem Neuronen und so weiter

115
00:06:28,240 --> 00:06:31,800
und darum ist es halt eben
wichtig, dass man, dass man das

116
00:06:31,800 --> 00:06:34,760
evaluieren laufend macht und
dass man es auch gut austest und

117
00:06:34,760 --> 00:06:38,240
evaluiert, bevor dass man es
deployed, also veröffentlicht,

118
00:06:38,960 --> 00:06:42,640
und dass man auch entsprechende
Sicherheitsschranken drin hat,

119
00:06:42,640 --> 00:06:46,240
dass das Modell, wenn es zum
Beispiel nicht weiter weiß.

120
00:06:46,640 --> 00:06:49,440
Nicht einfach etwas erfindet,
sondern entsprechend dann lieber

121
00:06:49,440 --> 00:06:52,440
den Nutzer aufmerksam macht und
sagt, Hey, ich weiß es nicht,

122
00:06:52,440 --> 00:06:54,800
ich kann es nicht beantworten.
Also heute ist es ja oft so.

123
00:06:54,960 --> 00:06:58,000
Gibt es beeindruckende Demos,
das staunt man, was die KI alles

124
00:06:58,000 --> 00:07:02,320
kann und alles macht, aber
gleichzeitig ist ja auch die

125
00:07:02,320 --> 00:07:05,960
Frage, ist es dann verlässlich
und gibt es dann eine

126
00:07:05,960 --> 00:07:07,640
Verlässlichkeit?
Ich glaube, da muss man, da muss

127
00:07:07,640 --> 00:07:10,320
man sehr gut unterscheiden.
Ja, also.

128
00:07:11,440 --> 00:07:14,520
Demos, die man so sieht, die
sind immer sehr beeindruckend,

129
00:07:14,520 --> 00:07:17,840
das stimmt, aber da muss man
halt wirklich auch sehen, dass

130
00:07:17,840 --> 00:07:22,240
viele Hersteller Sherry picken
betreiben und das das bedeutet

131
00:07:22,240 --> 00:07:27,440
eigentlich, dass sie alles
kontrolliert machen und halt

132
00:07:27,440 --> 00:07:29,920
Beispiele und Anwendungen
zeigen, wo sie vorher schon

133
00:07:29,920 --> 00:07:33,040
getestet haben, dass es genauso
gut funktioniert und das ist

134
00:07:33,040 --> 00:07:36,560
halt fundamental anders von
Problemen, die tagtäglich.

135
00:07:37,040 --> 00:07:39,600
Auftreten, wo man nicht alles
kontrollieren kann und wo auch

136
00:07:39,600 --> 00:07:43,200
manchmal ein Input reinkommt,
der nicht zu erwarten war.

137
00:07:43,760 --> 00:07:46,160
Also jedes Unternehmen will ja
heute dabei sein und zeigen, wir

138
00:07:46,160 --> 00:07:48,720
arbeiten mit KI und schaut mal,
was es alles kann.

139
00:07:48,880 --> 00:07:51,120
Aber wenn man jetzt wirklich
Entscheidungen treffen muss,

140
00:07:51,120 --> 00:07:53,760
dass man die KI einsetzt, wie,
wie kannst du denn als

141
00:07:53,760 --> 00:07:57,520
Entscheider erklären, ob ein ein
Ki System wirklich

142
00:07:58,160 --> 00:08:01,120
produktionsreif ist oder einfach
nur gut aussieht und

143
00:08:01,120 --> 00:08:05,480
beeindruckt?
Ja, eben alle seriösen oder die

144
00:08:05,480 --> 00:08:09,200
meisten seriösen Systeme machen
Evaluierungen auf andere

145
00:08:09,200 --> 00:08:14,000
Baselines also sie vergleichen
einerseits qualitativ, wie gut

146
00:08:14,000 --> 00:08:19,360
ist das Modell objektiv gesehen,
andererseits vergleichen sie es

147
00:08:19,360 --> 00:08:23,040
auch mit vorherigen Modellen und
so sieht man dann halt im

148
00:08:23,040 --> 00:08:25,520
direkten Vergleich was schneidet
besser ab, was schneidet

149
00:08:25,520 --> 00:08:27,520
schlechter ab.
Aber wenn ich jetzt.

150
00:08:28,080 --> 00:08:32,320
Ein KI Modell deployen würde und
ich müsste rausfinden ob ob es

151
00:08:32,320 --> 00:08:35,679
meinen Ansprüchen entspricht.
Dann müsste ich halt eben es mal

152
00:08:35,679 --> 00:08:39,039
auf einem auf einer Testumgebung
oder so laufen lassen schauen

153
00:08:39,039 --> 00:08:41,840
wie funktioniert es und halt
dann auch wirklich einen Plan

154
00:08:41,840 --> 00:08:44,480
haben wie ich das Ganze im Zaum
halte und auch wie ich schaue

155
00:08:44,480 --> 00:08:47,200
oder wie ich reagiere wenn mal
etwas rauskommt was nicht ideal

156
00:08:47,200 --> 00:08:48,480
ist.
Eben.

157
00:08:48,480 --> 00:08:51,920
Also machen wir einen Sprung.
Das Ganze wird immer komplexer,

158
00:08:52,120 --> 00:08:55,080
aber du sagst, wenn alles
komplexer wird, dann muss die

159
00:08:55,200 --> 00:08:57,800
Bedienung, die Oberfläche muss
dann einfacher werden und.

160
00:08:58,080 --> 00:09:01,880
Warum reicht es vielleicht jetzt
bald schon von bald nicht mehr,

161
00:09:01,880 --> 00:09:03,680
wenn man einfach nur ein Chat
Fenster hat?

162
00:09:04,240 --> 00:09:09,360
Ja, die grundsätzliche Natur von
einem Chat Fenster ist ja frage

163
00:09:09,360 --> 00:09:13,480
rein und Antwort raus.
Das funktioniert gut so wie man

164
00:09:13,480 --> 00:09:15,520
es jetzt die letzten Jahre
kennt, wenn man einfach mit

165
00:09:15,520 --> 00:09:18,960
einer KI kommunizieren will für
eine Frage eine Antwort, aber je

166
00:09:18,960 --> 00:09:23,600
komplexer das wird und je mehr
verschiedene Schritte in in den

167
00:09:23,600 --> 00:09:27,200
Aufgaben der KI drin sind.
Desto schwieriger wird das.

168
00:09:27,200 --> 00:09:29,920
Das ist, wie wenn man mit einem
Arbeitskollegen vielleicht über

169
00:09:29,920 --> 00:09:33,920
whatsapp kommuniziert, und da
ist es ja auch weniger einfach,

170
00:09:34,160 --> 00:09:37,120
als wenn man dem Gegenüber sitzt
oder wenn man mehr Möglichkeiten

171
00:09:37,120 --> 00:09:39,920
hat zur Kommunikation, und darum
ist ein chatfenster Halt gerade

172
00:09:39,920 --> 00:09:42,400
für komplexe Sachen etwas
eingeschränkt, also.

173
00:09:42,400 --> 00:09:44,720
Ich merk das ja auch schon, wenn
ich jetzt mit Claude was

174
00:09:44,720 --> 00:09:47,960
prompte, dann stellt Kurt
manchmal gegenfragen, das ist ja

175
00:09:47,960 --> 00:09:50,000
auch schon wie ein Gespräch, das
geht so in Richtung.

176
00:09:50,480 --> 00:09:53,920
Avatar kann man sagen oder dass
man, aber das wäre dann, das

177
00:09:53,920 --> 00:09:56,160
geht dann noch einen Schritt
weiter, dass es ein Gesicht hat,

178
00:09:56,160 --> 00:09:59,600
das mit einem spricht.
Ja, grundsätzlich sind Avatare

179
00:09:59,600 --> 00:10:04,000
in der KI alles, was zu dem
Nutzer spricht.

180
00:10:04,160 --> 00:10:07,280
Sei das durch Text, sei das
durch Sprache, durch einen

181
00:10:07,280 --> 00:10:10,080
visuellen Avatar.
Da gibt es natürlich

182
00:10:10,080 --> 00:10:14,360
verschiedene Komplexitätsstufen.
Also wie weit sind wir denn

183
00:10:14,360 --> 00:10:18,160
davon weg, dass ich mit einem KI
Avatar so ganz natürlich

184
00:10:18,160 --> 00:10:20,480
spreche?
Wie mit einem Kollegen.

185
00:10:21,040 --> 00:10:23,920
Es kommt immer darauf an, was
man als natürlich betrachtet.

186
00:10:23,920 --> 00:10:28,160
Wir haben zum Beispiel bei der
Sprache schon sehr gute

187
00:10:28,160 --> 00:10:30,720
Fortschritte gemacht, wir können
nicht nur textlich

188
00:10:30,720 --> 00:10:32,960
kommunizieren, wir können auch
über die Sprache kommunizieren,

189
00:10:32,960 --> 00:10:36,560
wo die KI Modelle auch in
Echtzeit schon antworten können,

190
00:10:36,560 --> 00:10:38,640
das sieht man auch bei diesen
Sprachfunktionen von

191
00:10:38,640 --> 00:10:43,120
beispielsweise Jet GPT, aber da
ist natürlich noch viel Luft

192
00:10:43,120 --> 00:10:46,080
nach oben, das ist immer noch
keine direkte Kommunikation,

193
00:10:46,080 --> 00:10:50,560
dafür fehlt einiges.
Ein Avatar, der wirklich sich

194
00:10:50,560 --> 00:10:54,000
anfühlt wie ein Kollege, der
muss nicht nur reagieren können,

195
00:10:54,000 --> 00:10:57,680
der muss auch kleinere Sachen
sehen.

196
00:10:57,680 --> 00:11:00,560
Zum Beispiel, wie man sich
bewegt, wie sich die Stimme

197
00:11:00,560 --> 00:11:03,400
verändert, aha, und so weiter
und sofort es gibt.

198
00:11:03,400 --> 00:11:06,640
Schon dass dass dann der Avatar
irgendwie merkt, du bist

199
00:11:06,640 --> 00:11:10,000
irgendwie nervös oder
unfreundlich, oder?

200
00:11:11,040 --> 00:11:13,920
Energisch, oder?
Und dann darauf auch irgendwie

201
00:11:13,920 --> 00:11:16,400
reagiert.
Ja, das ist wieder das Thema von

202
00:11:16,400 --> 00:11:18,480
verschiedenen KI Modellen, die
zusammenarbeiten.

203
00:11:18,480 --> 00:11:21,240
Es gibt ja schon KI Modelle, die
beispielsweise aus einem

204
00:11:21,240 --> 00:11:25,520
Videoinput von von einer Webcam
erkennen können, ob der Mensch

205
00:11:25,520 --> 00:11:29,920
der dem der dem Avatar gegenüber
steht, zum Beispiel nervös ist,

206
00:11:30,240 --> 00:11:34,960
ob er blinkt, wie oft er sich
umsieht, ob er schwitzt, wie oft

207
00:11:34,960 --> 00:11:37,520
er sich bewegt und so weiter und
sofort und diese Sachen können

208
00:11:37,520 --> 00:11:40,080
alle auch in die Avatare mit
eingebunden werden.

209
00:11:40,400 --> 00:11:44,200
Wir arbeiten zum Beispiel im
Moment an der ETH, am Computer

210
00:11:44,200 --> 00:11:46,560
Graphics Lab, an einem digitalen
Einstein.

211
00:11:46,880 --> 00:11:52,280
Ja, das ist eine Kopie des
originalen Einsteins, der auch

212
00:11:52,280 --> 00:11:56,040
an der ETH war, und dort haben
wir verschiedene Systeme, die

213
00:11:56,040 --> 00:11:59,520
zusammenarbeiten.
Also einerseits redet er er, er

214
00:12:00,160 --> 00:12:03,920
sucht sich Dialog aus oder er
generiert Dialog mit LEM System.

215
00:12:04,960 --> 00:12:08,560
Nutzt dann Sprachclon
Technologie, um auch wie

216
00:12:08,560 --> 00:12:12,720
Einstein zu reden und passt auch
die Animationen an und kann auch

217
00:12:12,720 --> 00:12:16,080
reagieren auf auf das Gegenüber
durch eine Webcam.

218
00:12:17,600 --> 00:12:22,920
Also das hört sich ja so auf
Anhieb sehr gut an, aber es ist

219
00:12:22,920 --> 00:12:26,240
vielleicht, das ist ja wieder so
eine ethische Geschichte, frage.

220
00:12:27,840 --> 00:12:30,800
Ist es vielleicht manchmal gar
nicht gut, wenn wir irgendwie

221
00:12:30,800 --> 00:12:33,360
dadurch vergessen, dass wir gar
nicht mit einem Menschen

222
00:12:33,360 --> 00:12:35,120
sprechen, sondern mit einer
Maschine?

223
00:12:35,920 --> 00:12:41,120
Ja, das das Thema gibt es schon
mit textbasierten KI Modellen,

224
00:12:41,520 --> 00:12:47,920
da gab es ja 2025 schon den
Fall, dass das JGPT 4 o Modell

225
00:12:47,920 --> 00:12:50,720
von Open AI.
Zurückgeschraubt wurde in der

226
00:12:50,720 --> 00:12:53,760
Persönlichkeitsentwicklung, weil
viele Leute eine persönliche

227
00:12:53,760 --> 00:12:56,080
Bindung zu dem Modell gefunden
haben.

228
00:12:56,080 --> 00:12:58,240
Davon hat auch Open Eye selber
gewarnt und das dann

229
00:12:58,240 --> 00:13:00,400
entsprechend wieder ein bisschen
zurückgeschraubt.

230
00:13:01,120 --> 00:13:04,560
Der Mensch ist halt drauf
ausgelegt, sobald das Gegenüber

231
00:13:04,560 --> 00:13:06,880
wirkt als wäre es echt und
empathisch ist, dass man dann

232
00:13:06,880 --> 00:13:09,800
automatisch eine Bindung
aufbaut, darum gibt es da immer

233
00:13:09,800 --> 00:13:13,040
ein bisschen die Verantwortung,
auch von den Modellherstellern,

234
00:13:13,280 --> 00:13:18,880
wo das ein um das Halt gewisser
Weise zu verhindern.

235
00:13:19,840 --> 00:13:24,600
Und dann auch immer klar zu
kommunizieren, Hey, da ist eine

236
00:13:24,600 --> 00:13:27,360
Maschine gegenüber und kein
Mensch, dass dass man das halt

237
00:13:27,360 --> 00:13:30,400
nicht irgendwie versucht zu
verheimlichen damit, dass jedem

238
00:13:30,400 --> 00:13:33,880
Nutzer eigentlich klar ist.
Also es gibt es ja auch, wenn

239
00:13:33,880 --> 00:13:35,960
man das jetzt noch weiterzieht.
Es gibt ja auch die Diskussion

240
00:13:35,960 --> 00:13:38,560
oft so in irgendwelchen Firmen,
die sagen, wir installieren

241
00:13:38,560 --> 00:13:42,280
jetzt irgendein KI System und
geben dir einen Namen Otto oder

242
00:13:42,280 --> 00:13:46,640
Jenny oder weiß ich was und man
sagt dann, ja, ich habe da noch

243
00:13:46,640 --> 00:13:48,640
mit Jenny gesprochen, es wird
also quasi.

244
00:13:49,680 --> 00:13:53,280
Man man setzt quasi die KI so
mit an den an den Tisch oder

245
00:13:53,280 --> 00:13:54,880
schließt sie so in die
Mitarbeitenden.

246
00:13:54,880 --> 00:13:58,840
Da gibt es aber Leute, die eben
sagen, man sollte das eigentlich

247
00:13:58,840 --> 00:14:03,280
nicht tun, weil es ist keine
Person, die irgendwie

248
00:14:03,280 --> 00:14:07,160
Verantwortung übernimmt oder so.
Ist das ne Frage, die mit mit

249
00:14:07,160 --> 00:14:09,040
der ihr euch auch
auseinandersetzt.

250
00:14:09,520 --> 00:14:12,160
Ja, also das ist ein großes
Forschungsgebiet.

251
00:14:12,480 --> 00:14:16,040
Wie macht man auch diese
Safeguards, dass dass die

252
00:14:16,040 --> 00:14:20,160
Menschen halt nicht diese
Bindung zu sehr aufbauen in

253
00:14:20,160 --> 00:14:24,080
einer in einem gewissen gesunden
Maß ist das aber meiner Meinung

254
00:14:24,080 --> 00:14:27,480
auch in Ordnung, ich meine, es
gibt auch Menschen, die geben

255
00:14:27,480 --> 00:14:31,880
ihrem Auto einen Namen und so
weiter und sofort, also wenn man

256
00:14:31,880 --> 00:14:35,480
halt diese gewisse Distanz hat
und weiß, schlussendlich ist das

257
00:14:35,480 --> 00:14:38,560
eine Maschine.
Dann ist das nicht

258
00:14:38,560 --> 00:14:40,800
problematisch.
Problematisch ist es halt, dass

259
00:14:40,800 --> 00:14:44,160
dann durch dadurch halt schnell
auch noch mehr entstehen kann

260
00:14:44,160 --> 00:14:46,120
und dann sind wir in diesem
Bereich, wo es halt auch

261
00:14:46,120 --> 00:14:47,800
psychologisch dann gefährlich
werden kann.

262
00:14:47,800 --> 00:14:52,240
Und das ist dann vielleicht mehr
ein eine, eine Challenge, ein

263
00:14:52,240 --> 00:14:57,200
mind Change, wie man so sagt,
oder ein Ansichtswechsel, den

264
00:14:57,200 --> 00:15:00,240
der Mensch vollziehen muss, dass
man sagt, ja nicht alles, was

265
00:15:00,240 --> 00:15:05,360
mir nicht jede Instanz, die mir
Antwort ist, automatisch ein

266
00:15:05,360 --> 00:15:06,760
Mensch oder ich muss da wirklich
unterscheiden.

267
00:15:06,920 --> 00:15:09,280
Leiden.
Man muss wirklich unterscheiden,

268
00:15:09,440 --> 00:15:12,400
mit wem man es zu tun hat.
Das geht ja dann auch weiter bei

269
00:15:12,400 --> 00:15:14,160
Robotern.
Also ich meine, es ist ja heute

270
00:15:14,160 --> 00:15:18,560
ist ja, wir reden jetzt hervor,
vorwiegend von Displays und und

271
00:15:18,560 --> 00:15:20,560
der virtuellen Welt, aber es
gibt ja dann wirklich die

272
00:15:20,560 --> 00:15:23,520
physischen, die Roboter, die
einem dann vielleicht schon

273
00:15:23,520 --> 00:15:28,320
sehr, sehr bald gegenüber sitzen
und dann auch so physisch wie

274
00:15:28,320 --> 00:15:31,080
Menschen agieren.
Ich kann mir auch vorstellen,

275
00:15:31,080 --> 00:15:35,920
dass das ganze halt jetzt ein
bisschen auch stark stärker ist.

276
00:15:36,240 --> 00:15:37,800
Weil halt die ganze Technologie
neu ist.

277
00:15:37,800 --> 00:15:39,760
Das ist neu für uns.
Wir haben das noch nicht gesehen

278
00:15:40,720 --> 00:15:44,160
früher.
Die ersten Computerspiele sahen

279
00:15:44,160 --> 00:15:46,800
ja nach heutiger Sicht auch
nicht wirklich toll aus, aber

280
00:15:46,800 --> 00:15:50,400
die Leute haben diskutiert, kann
das der psychisch Schaden, weil

281
00:15:50,400 --> 00:15:54,560
es zu echt ist und so, aber man
gewöhnt sich halt in gewisser

282
00:15:54,560 --> 00:15:58,160
Weise auch ein bisschen dran.
Also ich meine, die Diskussion

283
00:15:58,160 --> 00:16:02,720
gab es schon vorher mit Film und
Fernsehen und auch rein Audio

284
00:16:02,720 --> 00:16:05,120
das dann hieß ja ist das gut
und.

285
00:16:06,000 --> 00:16:08,280
Ja, wahrscheinlich ist es, muss
man sich dran gewöhnen.

286
00:16:08,280 --> 00:16:12,720
Es ist natürlich heute alles
viel, viel, viel intensiver und

287
00:16:12,960 --> 00:16:16,160
geht in viel mehr Bereiche rein,
eben wenn ich sehe, dass bei uns

288
00:16:16,160 --> 00:16:20,000
im Quartier schon die Pizzas
ausgeliefert werden von

289
00:16:20,000 --> 00:16:23,760
Roboterhunden es geht wirklich
in in sehr viele Bereiche rein,

290
00:16:23,760 --> 00:16:26,800
wo man es gar nicht für möglich
gehalten hätte.

291
00:16:26,800 --> 00:16:30,400
Wenn du jetzt aber so 3 Jahre
vorausschaust, was was wird sich

292
00:16:30,400 --> 00:16:37,200
da eine Arbeitswelt für.
In Sachen ki ändern oder durch

293
00:16:37,200 --> 00:16:39,280
ki ändern in der normalen
Arbeitswelt?

294
00:16:39,600 --> 00:16:42,880
Also ich denke sicher, dass die
KI bleiben wird, das ist klar

295
00:16:43,440 --> 00:16:46,480
und dass sie auch laufend besser
wird und immer mehr Aufgaben

296
00:16:46,480 --> 00:16:50,720
übernehmen kann und unterstützen
kann, was ich nicht glaube, ist,

297
00:16:50,720 --> 00:16:53,280
wie viele jetzt Angst haben,
dass die Jobs verschwinden

298
00:16:53,280 --> 00:16:56,560
werden komplett oder dass Leute
ersetzt werden durch KI, es

299
00:16:56,560 --> 00:16:59,440
ändert sich einfach die Arbeit.
Diesbezüglich, dass man

300
00:16:59,440 --> 00:17:01,840
vielleicht nicht mehr die ganzen
repetitiven Aufgaben selber

301
00:17:01,840 --> 00:17:05,200
machen muss, dass man nicht mehr
selber E Mails beantworten muss,

302
00:17:05,920 --> 00:17:08,280
dass man nicht mehr selber mit
dem Kunden telefonieren muss,

303
00:17:08,280 --> 00:17:10,400
wenn es keine wichtigen
Gespräche sind, sondern dass es

304
00:17:10,400 --> 00:17:12,640
mehr in eine Überwacherrolle
oder in eine.

305
00:17:13,200 --> 00:17:14,839
In eine.
Organisator.

306
00:17:14,960 --> 00:17:17,359
Genau.
Kubator oder so, ja.

307
00:17:17,520 --> 00:17:21,040
Dass dann vielleicht jeder
Mitarbeiter einen persönlichen

308
00:17:21,040 --> 00:17:25,119
KI Assistenten hat bei der
Arbeit, wo der seine repetitiven

309
00:17:25,119 --> 00:17:27,839
Arbeiten übernimmt, dass der
Mitarbeiter sich komplett darauf

310
00:17:27,839 --> 00:17:30,960
konzentrieren kann, halt das zu
machen, was der Mensch halt gut

311
00:17:30,960 --> 00:17:34,240
kann, zwar kreativ zu sein oder
neue Ideen zu finden und neue

312
00:17:34,240 --> 00:17:36,480
Produkte zu entwickeln und so
weiter.

313
00:17:36,880 --> 00:17:39,600
Also ich glaube mittlerweile,
dass die KI auch mindestens so

314
00:17:39,600 --> 00:17:44,000
kreativ sein kann, weil sie ja.
Aus viel mehr Quellen schöpfen

315
00:17:44,000 --> 00:17:46,560
kann und auch vielleicht offener
ist.

316
00:17:46,560 --> 00:17:52,560
Auch für Gedankensprünge, die
wir uns vielleicht aus

317
00:17:52,560 --> 00:17:54,800
irgendwelchen Befangenheiten gar
nicht trauen.

318
00:17:55,680 --> 00:18:00,200
Wie wie siehst du das oder
denkst du denn die die Maschine

319
00:18:00,200 --> 00:18:03,920
ist da, was Kreativität
betrifft, dem dem betrifft den

320
00:18:03,920 --> 00:18:07,720
Menschen immer unterlegen.
Grundsätzlich ist es ja so jetzt

321
00:18:07,720 --> 00:18:12,280
am Beispiel von KI basierten
Bildgenerationen, das ist ja

322
00:18:12,280 --> 00:18:15,840
auch sehr oft in der eher eine
große Thematik, auch ob das

323
00:18:15,840 --> 00:18:18,000
jetzt als Kunst zählt, ob es
nicht als Kunst zählt.

324
00:18:18,080 --> 00:18:20,880
Ja, ich sehe das so, dass
schlussendlich diese Bilder

325
00:18:20,880 --> 00:18:24,240
generiert werden anhand von
Trainingsdaten, also was das

326
00:18:24,240 --> 00:18:26,640
Modell gesehen hat beim Training
und die neuen Bilder sind

327
00:18:26,640 --> 00:18:28,880
einfach eine Kombination aus
allem, was er gesehen hat.

328
00:18:29,520 --> 00:18:32,880
Und das ist eine philosophische
Frage, ob das beim Menschen ja

329
00:18:32,880 --> 00:18:34,920
nicht auch ähnlich ist.
Ich mein, alles, was er

330
00:18:34,920 --> 00:18:38,280
erschafft, ist auch eine
Mischung aus allem, was bisher

331
00:18:38,280 --> 00:18:42,240
im Leben gesehen wurde.
Ich sehe, dass den Unterschied

332
00:18:42,240 --> 00:18:47,600
eher nicht bei der großen
Kreativität, sondern mehr, dass

333
00:18:47,600 --> 00:18:49,360
bei einer Maschine
schlussendlich immer noch

334
00:18:49,600 --> 00:18:52,040
Wahrscheinlichkeitsverteilungen
dahinter stehen, das heißt, es

335
00:18:52,040 --> 00:18:54,400
ist trotzdem alles mechanisch,
wie wenn jemand einen riesigen

336
00:18:54,400 --> 00:18:58,640
Würfel würfelt und so ein Bild
generiert und bei einem Menschen

337
00:18:58,640 --> 00:19:02,160
sind.
In Bildern und in Musik und in

338
00:19:02,240 --> 00:19:04,880
Filmen.
Alle Kunstwerke haben immer

339
00:19:04,880 --> 00:19:07,840
diesen persönlichen Touch, wo
auch ein bisschen die eigenen

340
00:19:07,840 --> 00:19:13,440
Gefühle oder das eigene erfahren
drin steckt und das fehlt halt

341
00:19:13,440 --> 00:19:16,640
bei einem Computer und ich
denke, dass man das immer spüren

342
00:19:16,640 --> 00:19:19,440
wird in gewissem Maß.
Jetzt noch mal zurück zum zum

343
00:19:19,440 --> 00:19:21,920
Grundthema.
Also du du du sagst, der Mensch

344
00:19:21,920 --> 00:19:24,280
wird vom prompt zum
Orchesterator was bedeutet das

345
00:19:24,280 --> 00:19:26,000
für die Skills?
Müssen wir jetzt neben dem

346
00:19:26,000 --> 00:19:28,560
Prompton auch noch das
Orchestrieren?

347
00:19:29,040 --> 00:19:34,480
Lernen oder anders prompten?
Ja, also wie am Anfang auch

348
00:19:34,480 --> 00:19:37,600
erwähnt, das klassische prompt
Engineering wo ich sage ich muss

349
00:19:37,600 --> 00:19:40,040
jetzt den prompt genau so
schreiben und wenn ich das

350
00:19:40,040 --> 00:19:42,160
ersetze durch das, dann wird es
vielleicht ein bisschen besser.

351
00:19:42,160 --> 00:19:44,160
Das wird immer mehr
verschwinden.

352
00:19:45,440 --> 00:19:47,760
Aber es ist halt immer noch
wichtig, und das ist fast das

353
00:19:47,760 --> 00:19:49,760
Wichtigste.
Und das ist ja eigentlich auch

354
00:19:49,760 --> 00:19:52,080
das, was hinter Protentionering
steckt.

355
00:19:52,080 --> 00:19:55,240
Dann im Gedanken schlussendlich,
wie kommuniziere ich diesem

356
00:19:55,240 --> 00:19:58,280
Modell, was ich will, und das
unterscheidet sich immer weniger

357
00:19:58,280 --> 00:20:01,760
davon von der Frage, wie
kommuniziere ich einem

358
00:20:01,760 --> 00:20:06,400
Teamkollegen, was ich will oder
einer Teamkollegin, und das

359
00:20:06,400 --> 00:20:08,720
wird, glaube ich, in Zukunft
immer mehr sein, dass wir diese

360
00:20:08,720 --> 00:20:11,600
kommunikativen Skills nicht nur
für Menschen haben müssen,

361
00:20:11,600 --> 00:20:14,240
sondern auch mit der Maschine.
Wie kommt man da rein?

362
00:20:14,240 --> 00:20:18,080
Einfach, indem man sich viel
damit beschäftigt, oder muss man

363
00:20:18,080 --> 00:20:26,240
da irgendwas einer Instruktion
oder oder so haben und bringen

364
00:20:26,240 --> 00:20:28,160
einen die Systeme automatisch da
rein?

365
00:20:28,960 --> 00:20:32,080
Ja, also ich denke, wenn man
immer wieder mit den Systemen

366
00:20:32,080 --> 00:20:35,840
redet, Mhm, dann entwickelt sich
da ein gewisses Gespür für.

367
00:20:36,040 --> 00:20:39,160
Man sieht ja dann, man hat ja
direkt n direktes Feedback, das

368
00:20:39,160 --> 00:20:41,360
hat gut funktioniert, das hat
nicht so gut funktioniert, wie

369
00:20:41,360 --> 00:20:44,640
auch wenn man mit einem Menschen
redet, Mhm, es hilft sich ja,

370
00:20:44,640 --> 00:20:47,960
wenn man wirklich komplett
wissen will, was passiert, wenn

371
00:20:47,960 --> 00:20:50,800
man dahinter guckt und auch
technisch anschaut, wie diese

372
00:20:50,800 --> 00:20:53,680
Modelle funktionieren.
Aber ich denke schon, dass man

373
00:20:53,680 --> 00:20:56,240
auch eine eine Intuition dafür
entwickeln kann, wenn man sich

374
00:20:56,240 --> 00:21:00,160
einfach drauf einlässt und halt
immer wieder mit den mit den KI

375
00:21:00,160 --> 00:21:02,320
Modellen interagiert.
Ja, vielen Dank.

376
00:21:02,320 --> 00:21:06,480
Das ist sehr spannend, was
gerade derzeit passiert und

377
00:21:06,560 --> 00:21:09,880
vielen Dank, dass du hier warst
und danke für das interessante

378
00:21:09,880 --> 00:21:12,000
Gespräch.
Sein gerne schön, danke.