★ DISPONIBILE PER FORMAZIONE E PROGETTI
enrico chiolo

SemStamp

La famiglia di watermarking semantico a livello di frase che ancora il segnale agli embedding del significato, per resistere alla parafrasi.

SemStamp è una famiglia di tecniche di in-processing watermarking semantico a livello di frase, non di singolo token, proposta da Hou et al. (SemStamp, 2024a) con la variante k-SemStamp (2024b).1 Invece di manipolare i logit token per token come il KGW watermarking, codifica il segnale usando gli embedding semantici dell’intera frase, tramite locality-sensitive hashing e rejection sampling: il modello rigenera la frase finché non cade nella “regione” semantica corretta per la chiave segreta.1 La letteratura sulla detection la inquadra tra i metodi generation-time a controllo del campionamento, confermando il meccanismo di mappatura della frase in spazio vettoriale, partizionamento per regioni e vincolo con rejection sampling.2

Perché esiste

I metodi token-level come KGW sono fragili alla parafrasi, perché la parafrasi cambia le parole superficiali pur preservando il significato, e KGW ancora il suo segnale proprio alle parole superficiali.2 Ancorando invece il segnale al significato della frase, all’embedding, il watermark sopravvive meglio alle riformulazioni lessicali che non alterano il contenuto semantico.2

k-SemStamp

La variante k-SemStamp sostituisce il partizionamento con iperpiani casuali di SemStamp con un clustering k-means sugli embedding delle frasi, per catturare meglio la struttura reale dello spazio semantico e migliorare ulteriormente la resistenza alla parafrasi e la robustezza della detection.1

Limiti

Il rejection sampling, che rigenera la frase finché non è “giusta”, introduce latenza extra in fase di generazione rispetto ai metodi token-level. L’efficacia dipende inoltre dalla qualità e dalla stabilità del modello di embedding usato, che può variare tra domini e versioni del modello: una dipendenza da componenti esterni che i metodi puramente token-level non hanno.12

Voci correlate

  • KGW watermarking — il limite, la vulnerabilità alla parafrasi, a cui SemStamp risponde con un approccio semantico
  • SIR — l’altro approccio semantico, con meccanismo diverso (modello di bias appreso)
  • In-processing watermarking — la categoria di appartenenza
  • LLM watermarking — la voce d’insieme

Bibliografia e sitografia

  • Phan, T. et al., A Survey on LLM Watermarking: Theory and Deployment, arXiv, luglio 2026.
  • Xiang, Li, Hu, Liu, AI-Generated Text Detection: Comprehensive Review, CMC-Computers, Materials & Continua, 2025.

Footnotes

  1. Phan et al., A Survey on LLM Watermarking, arXiv, 2026. 2 3 4

  2. Xiang et al., AI-Generated Text Detection, CMC, 2025. 2 3 4