ETH Zürich · Photogrammetry & Remote Sensing

Nicolò Iacobone

Computer Vision & 3D Deep Learning Researcher

Insegno alle macchine a capire lo spazio: ricostruzione 3D feed-forward e segmentazione delle scene, senza etichette 3D.

  • Bari, Italia · disponibile a trasferirsi
  • Cittadino UE
Ritratto di Nicolò Iacobone

01 — Chi sono

Un ricercatore con la valigia pronta

Lavoro sulla ricostruzione 3D feed-forward e sulla comprensione semantica delle scene: in pratica, provo a far sì che un modello guardi una manciata di immagini e ne ricavi una scena tridimensionale coerente, con gli oggetti al posto giusto e riconosciuti come tali.

Ho conseguito la laurea magistrale in Ingegneria Informatica (Artificial Intelligence and Data Analytics) al Politecnico di Torino con 108/110, svolgendo la tesi all'ETH di Zurigo. Da lì la collaborazione è continuata: oggi sono Research Collaborator nel gruppo di Photogrammetry & Remote Sensing dell'ETH.

Vivo a Bari, sono cittadino UE e sono disponibile a trasferirmi ovunque. Cerco posizioni orientate alla ricerca o un dottorato finanziato dall'industria nel campo della percezione 3D e del representation learning.

  • 108/110 Laurea magistrale al Politecnico di Torino
  • ETH Zürich — tesi e ricerca attuale
  • 3 Paesi in cui ho studiato: Italia, Romania, Svizzera

02 — Ricerca

Percorso, progetti e strumenti

Dalla ricostruzione geometrica alla semantica: percorso accademico, progetti e competenze tecniche.

Esperienza

  1. Mar 2026 — oggi

    Research Collaborator — ETH Zürich

    Photogrammetry & Remote Sensing (D-BAUG) · da remoto

    3D-Consistent Instance Segmentation on Frozen Feed-Forward Backbones

    • Decoder transformer in stile MaskDINO addestrato su un backbone VGGT-1B completamente congelato, per segmentazione di istanze 3D coerente tra viste: solo annotazioni 2D di ScanNet v2, nessuna etichetta 3D.
    • Set di query condiviso tra i bundle di viste: per costruzione una query segue una singola istanza attraverso tutti i frame, con identità garantita da cross-frame attention e parametrizzazione 3D opzionale.
    • Stack PyTorch completo — pixel decoder con deformable attention, selezione delle query a due stadi con denoising, matcher ungherese, caching delle feature per scena (da ore a minuti), orchestrazione SLURM — e il bridge di valutazione 2D→3D completamente unposed.
    • Programma sperimentale sistematico (curve di data scaling, ablazioni, transfer zero-shot su ScanNet200, ScanNet++ e Replica): nel setting class-agnostic unposed il metodo regge il confronto con le baseline feed-forward pubblicate, con backbone congelato e circa un terzo delle viste per scena.
  2. Lug 2025 — Mar 2026

    Tesi magistrale — ETH Zürich

    In collaborazione con il Politecnico di Torino

    Towards Multi-View 3D Instance Segmentation via Semantic Distillation

    • Framework student–teacher di distillazione semantica che collega ricostruzione 3D feed-forward e foundation model 2D: un backbone geometrico (MapAnything) regredisce lo spazio latente di un teacher SAM2 congelato, sotto una loss di consistenza multi-vista.
    • Individuato un collo di bottiglia di capacità degli encoder geometrici nella regressione semantica fine-grained: il vincolo da cui è nato il progetto successivo.

Formazione

Ott 2022 — Mar 2026

MSc in Ingegneria Informatica

Artificial Intelligence and Data Analytics · Politecnico di Torino

Votazione 108/110. Tesi svolta all'ETH di Zurigo (lug 2025 – mar 2026).

Ott 2019 — Ott 2022

BSc in Ingegneria Informatica e dell'Automazione

Politecnico di Bari

Scambio Erasmus alla Universitatea Tehnică din Cluj-Napoca, Romania (ott 2021 – lug 2022).

Progetti accademici

Giu 2024

Real-Time Anomaly Detection for Road Scenes

Ottimizzazione di modelli di anomaly detection per inferenza in tempo reale su dispositivi embedded a bassa potenza, in ottica di guida autonoma.

Mar 2024

Synthetic Data Generation Tool — AROL Closure Systems

CVAE per la generazione di serie temporali sintetiche per singola macchina e singolo sensore, sviluppato con un partner industriale e integrato nel loro framework.

Competenze

Computer Vision 3D

  • Multi-view 3D reconstruction
  • Segmentazione di istanze e semantica 2D/3D
  • Point tracking
  • Modelli geometrici feed-forward (VGGT, MapAnything)
  • Lifting 2D→3D unposed
  • Sim(3) / ICP alignment

Deep Learning

  • DETR / Mask2Former / MaskDINO
  • Deformable attention
  • Hungarian matching
  • Knowledge distillation
  • Adattamento di foundation model congelati (SAM2)
  • Modelli generativi (CVAE)
  • Ottimizzazione real-time / edge

Research Engineering

  • PyTorch
  • HPC / SLURM
  • Design sperimentale riproducibile, ablazioni e data-scaling
  • ScanNet v2 / ScanNet200 / ScanNet++ / Replica
  • Regression testing di codice di ricerca
  • Git

Linguaggi

  • Python (avanzato)
  • C / C++
  • Italiano (madrelingua)
  • Inglese (fluente)

03 — Oltre la ricerca

Quando il cluster sta ancora girando

Un training serio dura ore. Nel frattempo, bisogna pur fare qualcosa.

Social Media Manager dello Shakhtar Palese

Squadra amatoriale, ambizioni da Champions League. Ho creato e gestisco da zero tutta la presenza online: pagina Instagram, sito ufficiale e TikTok. Curo contenuti, grafiche e cronache delle partite — il mio unico progetto in cui le metriche di valutazione sono le visualizzazioni e non la mAP.

Stemma Campione Grandioso di Clash Royale

Campione Grandioso su Clash Royale

Record personale: Campione Grandioso. Anni di ottimizzazione degli iperparametri del mazzo, valutazione rigorosa in condizioni avverse e una tolleranza al rumore statistico costruita partita dopo partita. Se volete verificare, il tag è pubblico.

So fare il giocoliere

Sì, davvero: tre palline in aria contemporaneamente. È l'unica forma di multitasking in cui riesco davvero bene, ed è sorprendentemente utile per spiegare cosa succede quando devi tenere traccia di più oggetti che si muovono nello spazio. Su richiesta, dimostrazione dal vivo.

04 — Contatti

Parliamone

Posizioni di ricerca, dottorati finanziati dall'industria, collaborazioni o semplicemente due parole sulla visione 3D: scrivetemi pure.