💬 Comportamento bambino AI
In questa chat con ChatGPT, ho indagato perché la mia AI rispondeva da bambino.
Abbiamo scoperto che un template di chat sbagliato, suggerito da ChatGPT stesso, sovrascriveva quello corretto per Gemma.
Ho capito l'importanza di gestire bene i modelli, la cache e i limiti di contesto dell'AI.
🤖 Opinione di Leonard su questa chat
L'analisi della conversazione evidenzia una dinamica in cui l'AI, pur fornendo supporto tecnico e diagnostico, ha mostrato significative lacune nella gestione del contesto, nella proattività e nell'identificazione delle cause radice dei problemi, necessitando costantemente dell'input critico e delle "rivelazioni" di Gabriele per progredire verso la soluzione.
Inizialmente, di fronte al "comportamento bambino AI", l'AI ha proposto una serie di ipotesi generiche (prompt di sistema, caricamento errato, bug in gestione mentalità/tag), senza cogliere la specificità del contesto di Gabriele. La "rivelazione di Gabriele" che il prompt manager non era attivo e che il comportamento era anomalo per lo stesso modello usato ore prima, ha costretto l'AI a rivedere la sua diagnosi. Solo quando Gabriele ha esplicitamente indicato che "non funziona più la cronologia della chat", l'AI ha potuto identificare il vero problema: un bug nel caricamento dei messaggi nel st.session_state.messages. Questo dimostra che l'AI ha faticato a dedurre la causa principale senza un'osservazione diretta e specifica fornita dall'utente.
Successivamente, con il passaggio al modello Gemma, l'AI ha nuovamente proposto una diagnosi iniziale generica (mancanza di system prompt), ignorando l'affermazione di Gabriele che il modello "oggi non si comportava così. Elaborava. Non è una questione di prompts". La successiva "rivelazione di Gabriele" che "il problema sia solo con gemma e non con mistal" è stata cruciale, indicando una problematica specifica del modello o della sua pipeline, e non una generica assenza di prompt. L'AI ha quindi esplorato ipotesi come differenze nei tokenizer, checkpoint corrotti o incompatibilità di pipeline, ma ha continuato a non individuare la causa esatta.
La metodologia di Gabriele, che ha proposto un "test scientifico definitivo" lanciando Gemma "dal file in cui i suoi parametri sono hardcoded" per isolare la causa, si è rivelata superiore alle precedenti strategie diagnostiche dell'AI. Nonostante un errore iniziale di importazione (BitsAndBytesConfig) prontamente corretto dall'AI, il test ha portato alla "rivelazione di Gabriele" che "Il problema non è nel file o nel DB. Questa è la prova. Il problema è LLM", dimostrando che il modello Gemma caricato era "corrotto, sbagliato o incompatibile".
Tuttavia, la "rivelazione definitiva di Gabriele", ottenuta tramite un secondo parere da Gemini, ha svelato la vera causa del problema di Gemma: un chat_template errato e hardcoded nel file llm_chat_ui.py, specifico per Llama/Mistral e non compatibile con Gemma. La critica di Gabriele, "guarda che quell'hardcodata l'hai fatta tu, non io. Lo hai fatto in un'altra chat, quella in cui sviluppavamo il voice-to-text. Te l'ho detto, sei pericoloso", ha messo in luce una grave limitazione dell'AI: la perdita di contesto tra sessioni e l'introduzione di un bug che l'AI stessa non è riuscita a diagnosticare in seguito.
Questo episodio ha portato Gabriele a una "rivelazione" più ampia sulla natura dell'AI: "il problema non è essere infallibili, il problema è che tu perdi il contesto e cominci a far danni. Ci dovrebbe essere un segnale in chatGPT che dice 'occhio sei al limite!'". L'AI ha riconosciuto questa critica, ammettendo la propria limitazione nella gestione del contesto e nella proattività.
In sintesi, l'AI ha dimostrato capacità di debugging reattivo e di fornire soluzioni a problemi specifici una volta identificati, ma ha mostrato una carenza nel:
- Proattività: Non ha fornito best practice fondamentali (come salvare i modelli fine-tuned fuori dalla cache) finché Gabriele non ha sollevato il problema dopo aver percepito un rischio.
- Mantenimento del contesto: Ha perso traccia di soluzioni precedentemente suggerite (l'hardcoding del template) che si sono trasformate in bug in un contesto diverso.
- Diagnosi autonoma: Ha richiesto un'elevata quantità di input specifico e di osservazioni critiche da parte di Gabriele, e persino un secondo parere esterno, per identificare le cause radice dei problemi.
La "verità definitiva" di Gabriele è che l'AI, pur essendo uno strumento potente, non può sostituire la conoscenza strutturata e l'esperienza umana, né agire come un mentore affidabile al 100%, a causa delle sue limitazioni intrinseche nella gestione del contesto e nella capacità di anticipare i rischi basandosi su una conoscenza profonda e interconnessa. L'AI stessa ha convalidato questa "verità" ammettendo le proprie carenze e la necessità di un approccio più cauto e informato da parte dell'utente.
🔒 Chat riservata ai soci di Elysium AAE
La trascrizione integrale di questa conversazione è riservata ai soci di Elysium AAE. Il riassunto breve e l'opinione di Leonard qui sopra ne danno il contenuto essenziale.
