Hyeshim Kim

Paper Readings

Papers I presented at lab reading groups based on my research interests. Summaries and analysis reflect my own interpretations, not those of the authors. All figures belong to the cited papers.

IEEE CVPR2025

LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models

Fan-Yun Sun*, Weiyu Liu*, Siyi Gu, Dylan Lim, Goutam Bhat, Federico Tombari, Manling Li, Nick Haber, Jiajun Wu

Vision-Language Models (VLMs)Layout Generation
Reviewed Jul. 2026
IEEE CVPR2025Best Paper

VGGT: Visual Geometry Grounded Transformer

Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, David Novotny

3D ReconstructionFeed-ForwardMulti-Task Model
Reviewed Mar. 2026
IEEE CVPR2025Highlight

GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control

Xuanchi Ren*, Tianchang Shen*, Jiahui Huang, Huan Ling, Yifan Lu, Merlin Nimier-David, Thomas Müller, Alexander Keller, Sanja Fidler, Jun Gao

Video Diffusion3D ConsistencyCamera Control
Reviewed Feb. 2026
IEEE CVPR2023

Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models

Andreas Blattmann*, Robin Rombach*, Huan Ling*, Tim Dockhorn*, Seung Wook Kim, Sanja Fidler, Karsten Kreis

Video GenerationLDM
Reviewed Nov. 2025
NeurIPS2023Spotlight

MVDiffusion: Enabling Holistic Multi-view Image Generation with Correspondence-Aware Diffusion

Shitao Tang*, Fuyang Zhang*, Jiacheng Chen, Peng Wang, Yasutaka Furukawa

Text-to-3D Scene GenerationMulti-View Consistency
Reviewed Sep. 2025
NeurIPS2024

SceneCraft: Layout-Guided 3D Scene Generation

Xiuyu Yang*, Yunze Man*, Jun-Kun Chen, Yu-Xiong Wang

Text-to-3D Scene GenerationSpatial Guidance
Reviewed Jul. 2025
IEEE ICCV2023

Text2Room: Extracting Textured 3D Meshes from 2D Text-to-Image Models

Lukas Höllein*, Ang Cao*, Andrew Owens, Justin Johnson, Matthias Nießner

Text-to-3D Scene GenerationFoundation Model
Reviewed Apr. 2025

Last updated August 2026