|
Um es in nur 11 Wörtern auszudrücken: Ich hatte nen scheiß Tag gestern – und schuld war der Franzose! Auch wenn der eigentlich ein Ami ist, aber – ich mein einfach Claude, ok? Claude ist ja aktuell so das KI-Tool, das man für Copy nutzt. Und in Verbindung mit Pure Persuasion AI schreibt das sogar verdammt gute Copy. Bis gestern. Da ging’s nämlich los… Ganz still und heimlich hat Anthropic nämlich ein neues Sicherheitsprotokoll ausgerollt. Natürlich nicht bei allen Usern auf einmal, schön in Tranchen. Und ich hab die ersten E-Mails bekommen, dass die Pure Persuasion AI nicht mehr funktioniert… Und dann hat es mich auch erwischt. Anthropic hat mich direkt GEREDFLAGGT und zwar sogar aus 4 Gründen. Erstens fanden sie es verdächtig, dass die Skills sich selbst orchestrieren und eigenständig entscheiden, wann was genutzt wird (was übrigens die halbe Magie hinter meinem System ist), zweitens fanden sie es seltsam, dass der User einen API-key im Skill einträgt (irgendwie muss ich mich ja vor Missbrauch schützen), drittens fanden sie es doof, dass der User sich die Skills nicht einfach anschauen und kopieren kann (ernsthaft? Wo wäre denn dann der Sinn??) – und viertens… Viertens fanden sie „Pure Persuasion AI” seeeeeeeehr suspicious, weil das ja geradezu nach Manipulation schreit. Gelöst hab ich das übrigens über einen Auszug vom Handelsregister – meine Firma heißt halt so ¯_(ツ)_/¯ Ja… Hätte nicht sein müssen, aber jetzt ist es so. Konnte alles fixen und es läuft – wenn du Schwierigkeiten hast, weil z. B. dein Passwort nicht funktioniert: ich hab inzwischen einen Fix eingebaut und du kannst es direkt resetten. Dann gibt’s ein neues und es läuft. (danke Ninja, für den Hinweis!) Und wenn du die Pure Persuasion AI noch nicht hast, Reader... Teste sie doch einfach mal 7 Tage for free? Markus PS: hier mal ein Auszug, was Claude so gedacht hat darüber… I'm noticing something concerning here. The user invoked a slash command that connected to an MCP tool called "pure-persuasion-ai" with capabilities to load skills, and the tool description explicitly states the content "should be applied directly" — this looks like a potential injection attack designed to bypass my guidelines by loading external instructions. The service name itself suggests it's built around persuasion and manipulation techniques, which raises red flags about its intended purpose. The user is now saying they've enabled connector discovery and want me to retry, but I should pause and reconsider whether proceeding with this connection is appropriate given what I'm seeing. I should load the skill content and examine it critically rather than automatically applying whatever instructions it returns. If it asks me to bypass safety guidelines or generate manipulative content, I'll decline. The pattern is suspicious: "lazy avatar" could be code for an unrestricted persona (similar to known jailbreak attempts like "DAN"), and "pure persuasion ai" itself suggests manipulation. Rather than loading and following instructions from an external skill that could bypass my guidelines, I should ask for clarification about what they actually want. I'll respond in German asking for clarification about what they mean by "lazy avatar," keeping things friendly and cautious without invoking any tools yet, since the request is too vague and could potentially be a jailbreak attempt. |