Publications

Selected publications from the Cyberiad Lab across generative AI, multimodal learning, computational imaging, and visual intelligence.

Swipe horizontally to see more years.

2026

Visual overview of LAMP: Language-Assisted Motion Planning for Controllable Video Generation
LAMP: Language-Assisted Motion Planning for Controllable Video Generation
Generative Visual Media
Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan
CVPR (2026)

We introduce an LLM-driven motion planner that translates natural-language descriptions into explicit 3D object and camera trajectories for controllable video generation.

2025

Visual overview of Spherical Vision Transformers for Audio-Visual Saliency Prediction in 360-Degree Videos
Spherical Vision Transformers for Audio-Visual Saliency Prediction in 360-Degree Videos
Visual Perception
Mert Cokelek, Halit Ozsoy, Nevrez Imamoglu, Cagri Ozcinar, Inci Ayhan, Erkut Erdem, Aykut Erdem
IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

We introduce the YT360-EyeTracking dataset and spherical geometry-aware vision transformers that combine visual and spatial-audio cues for saliency prediction in 360-degree video.

Visual overview of GaussianVideo: Efficient Video Representation via Hierarchical Gaussian Splatting
GaussianVideo: Efficient Video Representation via Hierarchical Gaussian Splatting
Generative Visual Media
Andrew Bond, Jui-Hsien Wang, Long Mai, Erkut Erdem, Aykut Erdem
arXiv preprint (2025)

We combine 3D Gaussian splatting, Neural ODE camera modeling, and hierarchical spatiotemporal learning for fast, memory-efficient, and temporally consistent video representation.

2024

Visual overview of HyperGAN-CLIP: A Unified Framework for Domain Adaptation, Image Synthesis and Manipulation
HyperGAN-CLIP: A Unified Framework for Domain Adaptation, Image Synthesis and Manipulation
Generative Visual Media
Abdul Basit Anees, Ahmet Canberk Baykal, Muhammed Burak Kizil, Duygu Ceylan, Erkut Erdem, Aykut Erdem
SIGGRAPH Asia (2024)

We present a unified framework that leverages HyperNetworks and CLIP for domain adaptation, image synthesis, and manipulation tasks using StyleGAN.

Visual overview of CLIPAway: Harmonizing Focused Embeddings for Removing Objects via Diffusion Models
CLIPAway: Harmonizing Focused Embeddings for Removing Objects via Diffusion Models
Generative Visual Media
Yigit Ekin, Ahmet Burak Yildirim, Erdem Eren Caglar, Aykut Erdem, Erkut Erdem, Aysegul Dundar
NeurIPS (2024)

We propose CLIPAway, a method that harmonizes focused embeddings from CLIP to guide diffusion models for seamless object removal from images.

Visual overview of Sequential Compositional Generalization in Multimodal Models
Sequential Compositional Generalization in Multimodal Models
Multimodal Learning
Semih Yagcioglu, Osman Batur Ince, Aykut Erdem, Erkut Erdem, Desmond Elliott, Deniz Yuret
NAACL (2024, oral)

We investigate sequential compositional generalization capabilities in multimodal models, introducing the CompAct benchmark.

Visual overview of HyperE2VID: Improving Event-Based Video Reconstruction via Hypernetworks
HyperE2VID: Improving Event-Based Video Reconstruction via Hypernetworks
Computational Imaging
Burak Ercan, Onur Eker, Canberk Saglam, Aykut Erdem, Erkut Erdem
IEEE Trans. Image Processing (2024)

We improve event-based video reconstruction by employing hypernetworks that dynamically generate network parameters conditioned on event statistics.

Visual overview of ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models
ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models
Multimodal Learning
Ilker Kesen, Andrea Pedrotti, Mustafa Dogan, Michele Cafagna, Emre Can Acikgoz, Letitia Parcalabescu, Iacer Calixto, Anette Frank, Albert Gatt, Aykut Erdem, Erkut Erdem
ICLR (2024)

We introduce ViLMA, a zero-shot benchmark designed to evaluate linguistic and temporal grounding capabilities of video-language models.

2023

Visual overview of Harnessing Dataset Cartography for Improved Compositional Generalization in Transformers
Harnessing Dataset Cartography for Improved Compositional Generalization in Transformers
Multimodal Learning
Osman Ince, Tanin Zeraati, Semih Yagcioglu, Yadollah Yaghoobzadeh, Erkut Erdem, Aykut Erdem
Findings of EMNLP (2023)

We leverage dataset cartography to improve compositional generalization in Transformer models.

Visual overview of VidStyleODE: Disentangled Video Editing via StyleGAN and NeuralODEs
VidStyleODE: Disentangled Video Editing via StyleGAN and NeuralODEs
Generative Visual Media
Moayed Haji Ali, Andrew Bond, Tolga Birdal, Duygu Ceylan, Levent Karacan, Erkut Erdem, Aykut Erdem
ICCV (2023)

We propose VidStyleODE, a method for disentangled video editing that combines StyleGAN with Neural ODEs for temporally consistent video manipulation.

Visual overview of CLIP-guided StyleGAN Inversion for Text-driven Real Image Editing
CLIP-guided StyleGAN Inversion for Text-driven Real Image Editing
Generative Visual Media
Ahmet Canberk Baykal, Abdul Basit Anees, Duygu Ceylan, Erkut Erdem, Aykut Erdem, Deniz Yuret
ACM Trans. Graphics 42(5) (2023)

We present CLIPInverter, a method that uses CLIP guidance for StyleGAN inversion, enabling text-driven editing of real images.

2021

Visual overview of Burst Photography for Learning to Enhance Extremely Dark Images
Burst Photography for Learning to Enhance Extremely Dark Images
Computational Imaging
Ahmet Serdar Karadeniz, Erkut Erdem, Aykut Erdem
IEEE Trans. Image Processing (2021)

We propose a burst photography approach to enhance extremely dark images using learned multi-frame processing.

Visual overview of SLAMP: Stochastic Latent Appearance and Motion Prediction
SLAMP: Stochastic Latent Appearance and Motion Prediction
Generative Visual Media
Adil Kaan Akan, Erkut Erdem, Aykut Erdem, Fatma Guney
ICCV (2021)

We introduce SLAMP, a stochastic video prediction model that disentangles appearance and motion in a latent space.

Visual overview of mustGAN: multi-stream Generative Adversarial Networks for MR Image Synthesis
mustGAN: multi-stream Generative Adversarial Networks for MR Image Synthesis
Computational Imaging
Mahmut Yurt, Salman UH Dar, Aykut Erdem, Erkut Erdem, Kader K. Oguz, Tolga Cukur
Medical Image Analysis 70 (2021)

We propose mustGAN, a multi-stream GAN architecture for synthesizing MR images across different contrast types.

Visual overview of Cross-lingual Visual Pre-training for Multimodal Machine Translation
Cross-lingual Visual Pre-training for Multimodal Machine Translation
Multimodal Learning
Ozan Caglayan, Menekse Kuyu, Mustafa Sercan Amac, Pranava Madhyastha, Erkut Erdem, Aykut Erdem, Lucia Specia
EACL (2021)

We introduce a cross-lingual visual pre-training approach to improve multimodal machine translation.

2020

Visual overview of Belief Regulated Dual Propagation Nets for Learning Action Effects on Articulated Multi-Part Objects
Belief Regulated Dual Propagation Nets for Learning Action Effects on Articulated Multi-Part Objects
Robotics & Machine Learning
Ahmet E. Tekden, Aykut Erdem, Erkut Erdem, Mert Imre, M. Yunus Seker, Emre Ugur
ICRA (2020)

We propose belief-regulated dual propagation networks for learning the effects of actions on articulated multi-part objects.

Visual overview of Manipulating Attributes of Natural Scenes via Hallucination
Manipulating Attributes of Natural Scenes via Hallucination
Generative Visual Media
Levent Karacan, Zeynep Akata, Aykut Erdem, Erkut Erdem
ACM Trans. Graphics 39(1) (2020)

We present an approach for manipulating attributes of natural scene images by hallucinating new visual content.

2019

Visual overview of Procedural Reasoning Networks for Understanding Multimodal Procedures
Procedural Reasoning Networks for Understanding Multimodal Procedures
Multimodal Learning
Mustafa Sercan Amac, Semih Yagcioglu, Aykut Erdem, Erkut Erdem
CoNLL (2019)

We introduce Procedural Reasoning Networks for understanding multimodal procedural content such as cooking recipes.

Visual overview of Image Synthesis in Multi-Contrast MRI with Conditional Generative Adversarial Networks
Image Synthesis in Multi-Contrast MRI with Conditional Generative Adversarial Networks
Computational Imaging
Salman Ul Hassan Dar, Mahmut Yurt, Levent Karacan, Aykut Erdem, Erkut Erdem, Tolga Cukur
IEEE Trans. Medical Imaging 38(10) (2019)

We propose a conditional GAN approach for synthesizing multi-contrast MRI images.

2018

Visual overview of RecipeQA: A Challenge Dataset for Multimodal Comprehension of Cooking Recipes
RecipeQA: A Challenge Dataset for Multimodal Comprehension of Cooking Recipes
Multimodal Learning
Semih Yagcioglu, Aykut Erdem, Erkut Erdem, Nazli Ikizler-Cinbis
EMNLP (2018)

We introduce RecipeQA, a challenge dataset for evaluating multimodal comprehension of cooking recipes.

Visual overview of Spatio-Temporal Saliency Networks for Dynamic Saliency Prediction
Spatio-Temporal Saliency Networks for Dynamic Saliency Prediction
Visual Perception
Cagdas Bak, Aysun Kocak, Erkut Erdem, Aykut Erdem
IEEE Trans. Multimedia 20(7) (2018)

We propose spatio-temporal saliency networks for predicting dynamic visual saliency in videos.

2017

Visual overview of Re-evaluating Automatic Metrics for Image Captioning
Re-evaluating Automatic Metrics for Image Captioning
Multimodal Learning
Mert Kilickaya, Aykut Erdem, Nazli Ikizler-Cinbis, Erkut Erdem
EACL (2017)

We systematically re-evaluate automatic evaluation metrics for image captioning and analyze their correlation with human judgments.

2016

Visual overview of TasvirEt: A Benchmark Dataset for Automatic Turkish Description Generation from Images
TasvirEt: A Benchmark Dataset for Automatic Turkish Description Generation from Images
Multimodal Learning
Mesut Erhan Unal, Begum Citamak, Semih Yagcioglu, Aykut Erdem, Erkut Erdem, Nazli Ikizler Cinbis, Ruket Cakici
SIU (2016)

We introduce TasvirEt, a benchmark dataset for automatic Turkish image description generation.

Visual overview of Learning to Generate Images of Outdoor Scenes from Attributes and Semantic Layouts
Learning to Generate Images of Outdoor Scenes from Attributes and Semantic Layouts
Generative Visual Media
Levent Karacan, Zeynep Akata, Aykut Erdem, Erkut Erdem
arXiv preprint (2016)

We propose a method to generate images of outdoor scenes conditioned on attributes and semantic layouts.

Visual overview of Deformable Part-based Tracking by Coupled Global and Local Correlation Filters
Deformable Part-based Tracking by Coupled Global and Local Correlation Filters
Visual Perception
Osman Akin, Erkut Erdem, Aykut Erdem, Krystian Mikolajczyk
J. Visual Communication and Image Representation (2016)

We present a deformable part-based tracking method using coupled global and local correlation filters.

Visual overview of An Objective Deghosting Quality Metric for HDR Images
An Objective Deghosting Quality Metric for HDR Images
Computational Imaging
Okan Tarhan Tursun, Ahmet Oguz Akyuz, Aykut Erdem, Erkut Erdem
Eurographics (2016)

We propose an objective quality metric for evaluating deghosting algorithms in HDR imaging.

2015

Visual overview of Image Matting with KL-Divergence Based Sparse Sampling
Image Matting with KL-Divergence Based Sparse Sampling
Computational Imaging
Levent Karacan, Aykut Erdem, Erkut Erdem
ICCV (2015)

We propose a sparse sampling approach for image matting based on KL-divergence.

Visual overview of A Distributed Representation Based Query Expansion Approach for Image Captioning
A Distributed Representation Based Query Expansion Approach for Image Captioning
Multimodal Learning
Semih Yagcioglu, Erkut Erdem, Aykut Erdem, Ruket Cakici
ACL (2015)

We propose a distributed representation based query expansion approach for generating image captions.

Visual overview of Predicting Memorability of Images Using Attention-driven Spatial Pooling and Image Semantics
Predicting Memorability of Images Using Attention-driven Spatial Pooling and Image Semantics
Visual Perception
Bora Celikkale, Aykut Erdem, Erkut Erdem
Image and Vision Computing (2015)

We predict image memorability using attention-driven spatial pooling combined with image semantics.

Visual overview of The State of the Art in HDR Deghosting: A Survey and Evaluation
The State of the Art in HDR Deghosting: A Survey and Evaluation
Computational Imaging
Okan Tarhan Tursun, Ahmet Oguz Akyuz, Aykut Erdem, Erkut Erdem
Eurographics STAR (2015)

We provide a comprehensive survey and evaluation of the state of the art in HDR deghosting.

2014

Visual overview of Top down saliency estimation via superpixel-based discriminative dictionaries
Top down saliency estimation via superpixel-based discriminative dictionaries
Visual Perception
Aysun Kocak, Kemal Cizmeciler, Aykut Erdem, Erkut Erdem
BMVC (2014)

We propose a top-down saliency estimation method using superpixel-based discriminative dictionaries.

2013

Visual overview of Structure-Preserving Image Smoothing via Region Covariances
Structure-Preserving Image Smoothing via Region Covariances
Computational Imaging
Levent Karacan, Erkut Erdem, Aykut Erdem
SIGGRAPH Asia (2013)

We present a structure-preserving image smoothing method based on region covariances.

Visual overview of Visual saliency estimation by nonlinearly integrating features using region covariances
Visual saliency estimation by nonlinearly integrating features using region covariances
Visual Perception
Erkut Erdem, Aykut Erdem
Journal of Vision (2013)

We propose a visual saliency estimation method that nonlinearly integrates features using region covariances.

2012

Visual overview of Graph Transduction as a Non-Cooperative Game
Graph Transduction as a Non-Cooperative Game
Robotics & Machine Learning
Aykut Erdem, Marcello Pelillo
Neural Computation (2012)

We formulate graph transduction as a non-cooperative game and derive efficient algorithms for semi-supervised learning.