riccardo@polimi:~/portfolio
$ whoami
Ciao, sono Riccardo. Sì, l'ennesimo ingegnere, ma (quasi sempre) simpatico alle feste.

$ cat ./about.txt
Sono cresciuto in un paesino del Piemonte e, dopo essermi fatto le ossa
in Irlanda, a Torino e a Milano, ho fatto un master entusiasmante
in California, alla UC Berkeley, ed è lì che mi sono appassionato alla ricerca.
Ora faccio il dottorato al Polimi, nel gruppo RL3.

Traduzione: ho girato parecchio, ho collezionato troppi tesserini
universitari e ancora non ho imparato a cuocere la pasta come si deve
(sì, lo so, dovrei vergognarmi: sono italiano).

$ ls ./now/
phd_polimi/   rialco_srl/

$ echo $LOOKING_FOR
AI / ML / RL (decisioni sequenziali · sistemi multi-agente ·
feedback umano)
Marketing (pricing dinamico · sistemi di raccomandazione · pubblicità online)

$ echo $INTERESTS
🎾 padel  ·  🏃 corsa  ·  ⚽ Forza Inter  ·  ✈️ viaggi

$ _
// 01

dove trovarmi a settembre

/* 2026 */
  1. Poster di Drift Happens
    7 → 11 set · napoli

    ECML PKDD 2026

    La principale conferenza europea di machine learning, dove porto il poster di Drift Happens al workshop QCDS.

  2. Riccardo al Politecnico di Milano
    dall'11 set · milano

    Politecnico di Milano

    Qui inizio il dottorato, con una scrivania al quinto piano dell'Edificio 21, in via Bassini.

  3. Riccardo che corre PolimiRun Milano 26
    27 set · milano

    PolimiRun Milano 26

    Dieci chilometri di corsa per Milano, dal Campus Bovisa al Campus Leonardo.

  4. Il Tennis Club Alba visto dall'alto
    weekend · alba

    Tennis Club Alba

    Quasi tutti i weekend sono su un campo da padel al Tennis Club Alba: se ti va una partita, scrivimi.

// 02

chi sono

/* chi, cosa, perché */

Ciao, sono Riccardo. Mi occupo di reinforcement learning, in particolare di decisioni sequenziali, sistemi multi-agente e apprendimento da feedback umano.

Ho appena iniziato il dottorato al Politecnico di Milano, dopo un MEng in EECS alla UC Berkeley, un master alla Bocconi e la laurea triennale in ingegneria al Politecnico di Torino.

Quando non sono alla scrivania di solito gioco a padel e corro, guardo l'Inter e, se non l'avete ancora capito dalla mia storia, mi piace tantissimo viaggiare, conoscere gente nuova e vedere posti nuovi.

Tendo a essere molto competitivo (il più delle volte in modo scherzoso e sano) e mi piace lavorare con persone che alzano l'asticella senza togliere il divertimento.

// riccardo.stack
carburante espresso · pasta · gelato
allenamento padel (sponsorizzato, top 200 in italia) · corsa · nuoto
squadra Inter: per le gioie, i dolori e tutte le bestemmie nel mezzo
tappe nizza monferrato → irlanda → torino → milano → berkeley → milano
lingue italiano · inglese (ielts 8/9) · francese (annuisco per educazione)
volontariato OFTAL (coordinatore trasporti) · Banco Alimentare · AGAPE Onlus
~/life/ 5 scatti
01padel.jpg
02running.jpg
03ski_italy.jpg
04warriors.jpg
05party.jpg
~/life/travel/ 6 scatti
01cambodia.jpg
02finland.jpg
03toronto.jpg
04golden_gate.jpg
05hollywood.jpg
06grand_canyon.jpg
// 03

ricerca in corso

/* a cosa sto lavorando adesso */
~/research/hydramarl.md 2026 · neurips '26 main track · in valutazione
a1a2 a3a4 shared trunk head 1head 2 head 3head 4 un solo parametro λ si muove tra i due regimi
actor & critic · tronco condiviso ⇄ una testa per agente λ = 1.00 · shared

HydraMARL

Uno studio sui fondamenti della condivisione dei parametri nel reinforcement learning multi-agente cooperativo. HydraMARL scompone la policy network e la value network di ogni agente in un tronco condiviso da tutti gli agenti e una testa individuale, con la stessa decomposizione per actor e critic; un singolo parametro continuo copre l'intero spettro dalla condivisione completa alla piena indipendenza. Esperimenti sistematici sulla suite di benchmark VMAS individuano il regime di condivisione ottimale e ne caratterizzano la sensibilità alla struttura del task, al grado di cooperazione e alla dimensione della popolazione.

Quando molti agenti imparano insieme, parti delle loro reti neurali possono essere condivise. Misuriamo quanto aiuti davvero condividere e mettiamo in luce il compromesso tra imparare in fretta e imparare a specializzarsi.

  • rl multi-agente
  • condivisione parametri
  • neurips '26
~/research/klip_ppo.md 2026 · preprint arXiv · klip-ppo.org ↗
0 + I_kill I_kill I_pass I_pass I_in 1−ε 1 1+ε rapporto di importanza w → vantaggio Â
piano w–Â · dove il clipping sopprime l'aggiornamento I_in · β = 0

KLip-PPO

Un'unificazione teorica di PPO-Clip e PPO-KL, le due varianti dominanti dell'algoritmo policy-gradient più usato nel reinforcement learning moderno. Dimostriamo un'equivalenza campione per campione: il gradiente del surrogato con clipping è esattamente una penalità KL con un coefficiente diverso per ogni campione, in forma chiusa nel rapporto di importanza e nel vantaggio. L'identità vale a ogni passo di aggiornamento e su cinque benchmark MuJoCo le due loss producono curve di addestramento indistinguibili. Il risultato fa collassare in un unico spazio di progettazione quella che in letteratura era trattata come una spaccatura e fa emergere una famiglia ben fondata di generalizzazioni di PPO.

PPO è l'algoritmo più usato nell'RL moderno. Le sue due varianti principali erano trattate come idee diverse: dimostriamo che calcolano lo stesso aggiornamento e verifichiamo l'identità su cinque benchmark MuJoCo.

  • teoria rl
  • ppo
  • policy optimization
~/research/drift_happens.md 2026 · pubblicato @ qcds, ecml-pkdd '26 · drift-happens.org ↗
Il ritratto medio degli annuari per decennio, dagli anni 1910 agli anni 2010.
~/yearbook/mean_face · ritratto medio per decennio 1910s
eval 1960 eval 1980 eval 2000 cnn_l
Saliency della CNN, valutazione 1960: l'attribuzione si concentra sui tratti del viso.
Saliency della CNN, valutazione 1980.
Saliency della CNN, valutazione 2000.
resnet_s
Saliency della ResNet, valutazione 1960.
Saliency della ResNet, valutazione 1980.
Saliency della ResNet, valutazione 2000.
mlp_l
Saliency dell'MLP, valutazione 1960: l'attribuzione è distribuita su tutta l'immagine.
Saliency dell'MLP, valutazione 1980.
Saliency dell'MLP, valutazione 2000.
saliency · addestrate ≤ 1950 · dove guarda ogni rete eval 1960

Drift Happens

Cosa succede a una rete neurale quando il mondo si allontana dai dati su cui è stata addestrata? L'abbiamo misurato su un secolo di ritratti, un decennio di recensioni di prodotti e 25 anni di abstract scientifici. Il modello con il miglior punteggio held-out alla data di cutoff dell'addestramento è spesso il meno robusto una volta in produzione. A governare la velocità del degrado è la forza del suo bias induttivo: un bias più forte estrae le feature più discriminative e legate al periodo, ed è in testa in-distribution, ma proprio quelle feature sono le prime a perdere significato quando la distribuzione dei dati si sposta. Gli encoder pre-addestrati e congelati si collocano in un regime diverso: cedono accuratezza in-distribution in cambio di un comportamento più stabile nel tempo. L'architettura andrebbe scelta in base all'orizzonte di riaddestramento previsto, non solo all'accuratezza in-distribution.

I modelli di AI perdono accuratezza man mano che il mondo si allontana dai loro dati di addestramento. Su decenni di volti, recensioni e articoli, i modelli più tarati sugli anni di addestramento sono i primi a cedere su quelli successivi.

  • reti neurali
  • distribution shift
  • empirico
~/robotics/hold_your_plate.md 2025 · robotica · holdurpla7e.org ↗
~/sim/arm_hero.webm · rollout della policy t=0.0s
Grafici a barre che confrontano PID e residual PPO su 10 condizioni: tasso di caduta della pallina ed errore di inseguimento.
pid vs residual ppo · 10 condizioni · clicca per ingrandire cadute 70→3,3%

Hold Your Plate

Stabilizzazione in tempo reale di una pallina su un piatto con un braccio collaborativo UR7e, tracciamento visivo con marker ArUco tramite una telecamera Intel RealSense, il tutto orchestrato su uno stack ROS 2 completo e una pipeline di simulazione MuJoCo. Il sistema confronta tre controllori: un PID tarato a mano, un MPC sulla dinamica linearizzata e un approccio di residual learning che affianca al PID una piccola policy PPO addestrata con domain randomization (variando massa, attrito e ritardo dei sensori), e unisce l'affidabilità del controllo basato su modello alla robustezza agli effetti non modellati che la policy impara da sé.

Un braccio robotico UR7e che tiene in equilibrio una pallina su un piatto inclinabile, con una telecamera che la segue in tempo reale. Mette a confronto tre controllori (classico, basato su modello e appreso) su uno stack ROS 2.

  • ros 2
  • residual rl
  • ur7e
  • mujoco
  • visione
~/research/demand.md 2026 · framework

DEMAND / no-steady-state

Un framework di ricerca per il reinforcement learning multi-agente con domanda non stazionaria, rivolto ai problemi di dispacciamento di flotte nel delivery, nel ride-hailing e nella logistica. La piattaforma modella l'intero stack operativo (matching degli ordini, routing, riposizionamento dei corrieri) con una deriva esogena realistica, con integrazione plug-and-play di oltre 15 algoritmi RL (PPO, SAC, varianti multi-agente, euristiche classiche). Pensato per gli studi controllati sulla deriva che gli attuali benchmark MARL non permettono.

Una piattaforma di ricerca per studiare come i sistemi di dispacciamento basati su AI (food delivery, ride-hailing) reggono quando la domanda continua a cambiare. Pipeline di simulazione completa con molti algoritmi già integrati.

  • rl multi-agente
  • simulazione
  • operations
~/capstone/no_free_lunch.md 2026 · tesi capstone meng · informs/meituan

No Free Lunch for Food Delivery

Uno studio multi-obiettivo delle policy di assegnazione dei corrieri sui dati reali delle consegne Meituan, dove tempi di attesa del cliente, guadagni dei corrieri, margine della piattaforma e affidabilità dei ristoranti sono in conflitto. Confrontiamo euristiche classiche e reinforcement learning moderno, poi proponiamo PRISM: un'architettura ibrida che combina un predittore di costo appreso, RL e ottimizzazione vincolata e tratta i compromessi di Pareto come obiettivi a pieno titolo invece di schiacciarli in una ricompensa scalare.

Nel food delivery clienti, corrieri, piattaforme e ristoranti vogliono cose diverse dalla stessa decisione. Costruito sui dati reali di Meituan, PRISM tratta quei compromessi come obiettivi a pieno titolo invece di fingere che non esistano.

  • ricerca operativa
  • multi-obiettivo
  • dati reali
// 04

scatti

/* un ritratto della mia vita · i quadri nascondono degli easter egg */
~/life/quadri/ 5 scatti · con easter egg
01quadro_01.jpgEE
02quadro_02.jpgEE
03quadro_03.jpgEE
04quadro_04.jpgEE
05quadro_05.jpgEE
// 05

cv

/* cronologia */

# formazione

  1. set 2026 → oggi
    Dottorato in Information Technology · XLII ciclo Reinforcement learning da feedback umano in contesto multi-agente, nel gruppo RL3 (AIRLab, DEIB). Supervisori: Prof. Alberto Maria Metelli e Prof. Marco Mussi, nell'ambito del progetto MUR Unified Learning from Diverse Human Feedback (HUmLrn, FIS-2023-02598).
  2. ago 2025 → mag 2026
    UC Berkeley · Berkeley, California GPA 4.0 / 4.0
    MEng in Electrical Engineering & Computer Sciences Teoria dell'apprendimento statistico (CS C281A, Recht), machine learning (CS 289A), deep reinforcement learning (CS 285, Levine), ottimizzazione (EECS 227AT, Sojoudi), robotica (EECS C206A). Capstone seguito dal Prof. Paul Grigas (IEOR). Fung Excellence Scholar: riconoscimento al merito di Berkeley Engineering per i migliori studenti MEng.
  3. set 2023 → mag 2025
    Università Bocconi · Milano 110 e lode / 110
    Master in Marketing & Communication (MiMeC) Valedictorian: miglior studente del corso. Borsa di studio al merito. Programma quantitativo incentrato su analytics, comportamento del consumatore, strategie di pricing e decisioni basate sui dati.
  4. set 2017 → lug 2021
    Politecnico di Torino · Torino 110 e lode / 110
    Laurea triennale in Ingegneria Elettronica e delle Comunicazioni Primo del corso · corso di laurea ICT in inglese. Intraprendenti (Percorso Giovani Talenti): tra i 200 migliori studenti dell'ateneo. Tesi sulla simulazione di un PLL digitale.
  5. ago 2015 → giu 2016
    Coláiste Chríost Rí · Cork, Irlanda
    Anno di scambio · scuola superiore in lingua inglese Anno scolastico in piena immersione con compagni irlandesi, nel percorso del Liceo Scientifico Internazionale. Ho giocato nella squadra di basket della scuola.

# esperienza

  1. gen → lug 2025
    Lenovo · Milano
    Marketing Specialist · CRM Digital Services CRM e marketing analytics: segmentazione dei clienti, analisi delle campagne, esplorazione dei dati CRM. Ho trasformato le analisi in indicazioni per marketing e crescita, in una multinazionale che lavora su grandi volumi di dati.
  2. 2021 → 2025
    Rialco S.R.L. · Milano
    CEO / Product Manager / Growth Manager Responsabile della direzione strategica e del conto economico di una società di consulenza digitale. Ho seguito i prodotti digitali (web, e-commerce, strumenti interni) dalla discovery al rilascio. Ho gestito acquisizione e conversione su SEO, campagne a pagamento e social, definendo i KPI e usando gli analytics per capire su cosa intervenire nel funnel.
  3. gen → lug 2020
    Biesse Sistemi S.R.L. · Nizza Monferrato
    Stagista · Sviluppo software Applicazione a comando vocale per la prenotazione automatica di taxi: logica applicativa e integrazione di sistema, affiancato da uno sviluppatore senior.

# pubblicazioni & preprint

  1. mag 2026
    HydraMARL: Isolating the Parameter-Sharing Spectrum in Multi-Agent Reinforcement Learning in valutazione
    Holzinger, R.* & Colletti, R.* Sottomesso a NeurIPS 2026, main track.
  2. giu 2026
    KLip-PPO: A per-sample KL perspective on PPO-Clip preprint
    Colletti, R.* & Holzinger, R.* arXiv:2606.23932 · klip-ppo.org · codice · w&b artifacts · prevista sottomissione a un workshop NeurIPS 2026.
  3. set 2026
    Drift Happens: An Empirical Study of Neural Architecture Robustness to Temporal Distribution Shift pubblicato
    Holzinger, R.* & Colletti, R.* QCDS Workshop @ ECML-PKDD 2026, Napoli · arXiv:2607.05908 · atti · drift-happens.org · codice · w&b artifacts.

* pari contributo

# premi & borse di studio

  1. 2025
    Fung Excellence Scholarship · UC Berkeley Assegnata da Berkeley Engineering ai migliori candidati MEng.
  2. 2025
    Valedictorian + borsa di studio al merito · Università Bocconi Miglior studente del corso.
  3. 2025
    Data Science and Machine Learning · MIT IDSS Making Data-Driven Decisions · programma di certificazione professionale (mag–ott 2025).
  4. 2017 → 2021
    Intraprendenti (Percorso Giovani Talenti) · Politecnico di Torino Tra i 200 migliori studenti dell'ateneo.
  5. 2016
    Olimpiadi della Matematica, finalista nazionale · gara a squadre Tornato dall'Irlanda per una settimana, in pieno anno di scambio, per le finali nazionali.

# volontariato

  1. 2010 → oggi
    OFTAL · volontario, oggi coordinatore trasporti Da più di 15 anni accompagno i pellegrinaggi che portano malati e persone in difficoltà economica a Lourdes e ad altri santuari.
  2. 2014 → 2018
    Fondazione Banco Alimentare Onlus Selezione e distribuzione di alimenti a famiglie in difficoltà.
  3. 2014
    AGAPE Onlus Smistamento e distribuzione di alimenti per la comunità locale.

$ open cv.pdf ↗ · resume.pdf ↗