{"as_of":"2026-08-11T15:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3ebb639b3f45308d71afb54adcf620594c16585f2f53d15fdd531e54a30c94b","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:56:17.729124Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03173/citation-record","integrity":"/paper/2501.03173/integrity","json":"/paper/2501.03173/citation-record.json","paper":"/paper/2501.03173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.349440Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.349440Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:223ccf3b855e314d1b98a1cd31b16ad085c54fd2897b13f3700c341175f306c4","observation_id":"1ceea53d-45f1-43e7-9547-1a34f25c7fa8","resolution":{"observed_at":"2026-08-10T21:56:17.349440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.948867Z","title":"Dynamiccity: Large-scale lidar gener- ation from dynamic scenes, 2024","venue":null,"work_id":"26cbdb83-8c6d-417a-80d0-4660a75ebdf7","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.354943Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:74c652af17a6a84586f345a7698de086b97d9425acaf5db3a1af72e5da34db93","observation_id":"f4abcf9c-9d23-4c5b-b5c3-5d1c2a1a0c9f","resolution":{"observed_at":"2026-08-10T21:56:18.954128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.931644Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"5d5ca38a-fe49-4db9-ac16-d8e834afc9a6","year":2020},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.360917Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c0c71ed4b0c29856b8d6bc44c06c07fc995e6f8e28d2e2c8872a0102de2f4d94","observation_id":"fb35b2a9-aae3-4e8b-800a-a074fb36f1a1","resolution":{"observed_at":"2026-08-10T21:56:18.937266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11573","last_updated":"2024-03-20T01:13:48Z","snapshot_observed_at":"2026-08-10T13:01:31.607191Z","submitted_at":"2024-03-18T08:50:04Z","title":"Just Add $100 More: Augmenting NeRF-based Pseudo-LiDAR Point Cloud for Resolving Class-imbalance Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11573","snapshot_observed_at":"2026-08-10T21:56:17.366229Z","title":"Just add $100 more: Augmenting nerf-based pseudo-lidar point cloud for resolving class-imbalance problem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.366229Z"},"links":{"cited_paper":"/paper/2403.11573","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:feb9b8026ca7c49f4e3af85619495004d74eee181c66cd8ab6529f586674414a","observation_id":"3ec9a4be-7981-4aed-aa8c-fd2c93cab1de","resolution":{"observed_at":"2026-08-10T21:56:17.366229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-09T10:44:37.868390Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-10T21:56:17.372452Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.372452Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:b0ce28d3f900be535f4aaeec9083953c23f4b8236a5a26fe936d638301fcd0b1","observation_id":"31a25eec-0050-4a4e-9db4-e487a5f2f5de","resolution":{"observed_at":"2026-08-10T21:56:17.372452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.915662Z","title":"Geosim: Realistic video sim- ulation via geometry-aware composition for self-driving","venue":null,"work_id":"b71b22f9-be55-4d20-98af-5ef2ccf48fbe","year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.378087Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:da876d19edb4136da59f71c223d129765d3290716d27cd2035a13e0ee2dccdf5","observation_id":"e201e549-1cf1-4e75-b3f0-fe1a1fdbd46c","resolution":{"observed_at":"2026-08-10T21:56:18.920739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16392","last_updated":"2024-07-12T18:19:19Z","snapshot_observed_at":"2026-08-05T01:35:52.697907Z","submitted_at":"2024-02-26T08:32:41Z","title":"Placing Objects in Context via Inpainting for Out-of-distribution Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16392","snapshot_observed_at":"2026-08-10T21:56:17.383508Z","title":"Placing objects in context via in- painting for out-of-distribution segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.383508Z"},"links":{"cited_paper":"/paper/2402.16392","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:509df814113414f94c76711cb388ac3d4c56bd7141f459954efa29d0dd0b0d20","observation_id":"8ad4d6d2-fcae-4603-a6b5-7852b415057d","resolution":{"observed_at":"2026-08-10T21:56:17.383508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.899392Z","title":"Cut, paste and learn: Surprisingly easy synthesis for instance de- tection","venue":null,"work_id":"d5d1faeb-36d7-4be8-b73c-8bbdbe75e0b2","year":2017},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.389496Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:21933d07abde32321b22ff0603a00b311111a7e6dab98580336f86834c067b71","observation_id":"8f35d35b-3f7f-490e-ae88-b43183191bf1","resolution":{"observed_at":"2026-08-10T21:56:18.904477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.394991Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.394991Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:10958abcb665b70d4c1c6135f04c12501a584d66e97c453d7110b9914861971d","observation_id":"ec0dc077-5d3e-4b17-9400-1b2ac12adfd2","resolution":{"observed_at":"2026-08-10T21:56:17.394991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02601","last_updated":"2024-05-03T04:50:27Z","snapshot_observed_at":"2026-08-06T19:21:54.069156Z","submitted_at":"2023-10-04T06:14:06Z","title":"MagicDrive: Street View Generation with Diverse 3D Geometry Control","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02601","snapshot_observed_at":"2026-08-10T21:56:17.400022Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.400022Z"},"links":{"cited_paper":"/paper/2310.02601","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:f06e9bb9cff94292d1e572523e38db1394555669fbfab2de464ab03ed131ad40","observation_id":"4a2d0f31-e302-4ae8-9474-f05098c7a7d3","resolution":{"observed_at":"2026-08-10T21:56:17.400022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.873343Z","title":"Multitest: Physical-aware object insertion for testing multi-sensor fusion perception systems","venue":null,"work_id":"a10748a7-c012-4b8b-b00b-8bc01710cda6","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.405681Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:38426200e20d63de258c972a3239103f475ee34f40a595bf393fa91eb93eff85","observation_id":"30eb62cf-3d8e-4c71-a58c-5b2e5a22511e","resolution":{"observed_at":"2026-08-10T21:56:18.878466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.07836","last_updated":"2017-09-08T00:29:55Z","snapshot_observed_at":"2026-07-06T05:31:22.319094Z","submitted_at":"2017-02-25T06:04:42Z","title":"Synthesizing Training Data for Object Detection in Indoor Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.07836","snapshot_observed_at":"2026-08-10T21:56:17.410637Z","title":"Synthesizing training data for object de- tection in indoor scenes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.410637Z"},"links":{"cited_paper":"/paper/1702.07836","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:f9c2a2a104502510f7e328b9f41a4f1d40a8fac37ffb402d9d074005c8fcac88","observation_id":"92d1b274-6a43-4751-ade1-031c7dccfe12","resolution":{"observed_at":"2026-08-10T21:56:17.410637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.856786Z","title":"Sim- ple copy-paste is a strong data augmentation method for in- stance segmentation","venue":null,"work_id":"e818ad74-62de-4781-90a7-defc50ebb382","year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.415762Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:cd89030bf85681c7b366a18b393fb907d92e4e59f5f6fb19b6bb616251698e0a","observation_id":"8c3a3708-31af-4e60-805a-ccac02f07346","resolution":{"observed_at":"2026-08-10T21:56:18.862232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.420544Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.420544Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:cc2c8223b519c06764054f69d1d9eccca55589c56d9826be0359864e483f8253","observation_id":"d65d071e-b193-48e9-ae1e-737705f845f8","resolution":{"observed_at":"2026-08-10T21:56:17.420544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.830850Z","title":"Lift-attend-splat: Bird’s-eye-view camera-lidar fusion using transformers, 2024","venue":null,"work_id":"2270f521-d444-4d65-beb9-51eb988a25fb","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.425270Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:29477656d4ec3dae9eb22fff3e9fcd1fc9bfa9f5c31c5c36a56a31c1dbd4873a","observation_id":"3ad0f58f-248b-490b-94a0-b992e527141e","resolution":{"observed_at":"2026-08-10T21:56:18.836102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.430058Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.430058Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:f37849db9c108f5d466b485d2dc3c7407c535aba673dc7d509bae3ad7a7d708a","observation_id":"ea9c71a9-1651-4e93-a135-1f6b7c18751e","resolution":{"observed_at":"2026-08-10T21:56:17.430058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T21:56:17.434893Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.434893Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c7ae9e6ee005e5aae54f282c35a2632295d9eb4dcf2b046de71df5a910e152cf","observation_id":"983f6922-7551-43d9-9ae9-d78abcdf0186","resolution":{"observed_at":"2026-08-10T21:56:17.434893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.440318Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.440318Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:6e4446663e5f4c03e5db222799dae351f3a6468202e2af474248ef78bb8e507c","observation_id":"37b2e307-75ba-444d-8961-ed5250f7f0c7","resolution":{"observed_at":"2026-08-10T21:56:17.440318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.794677Z","title":"Rangeldm: Fast realistic lidar point cloud generation, 2024","venue":null,"work_id":"acdd7a47-9c25-427f-bca3-d075923c8ff8","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.447599Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a1dd97f1bdb4d3e44f4bcb057205e05c3cd55067b2a7570f03de5b5cd16c76e5","observation_id":"436074c9-675a-4c56-b87e-7b7892636228","resolution":{"observed_at":"2026-08-10T21:56:18.799535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.778978Z","title":"Subjectdrive: Scaling generative data in autonomous driving via subject control, 2024","venue":null,"work_id":"e09a81f0-3825-43f1-9517-d3b81b905840","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.453739Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a854509c623545d43c66be19c2404993ada05b5ddaa704ffee5d9a558735a702","observation_id":"ed158624-8ff3-4fef-9e97-029e44d57853","resolution":{"observed_at":"2026-08-10T21:56:18.783984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T21:56:17.459541Z","title":"Auto-encoding vari- ational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.459541Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:545890239694fa49f29f6fed236027083301bca71a36b08e8e69d070b0fcdccb","observation_id":"b3bb0344-3905-4d37-9ecb-04d4dc72dd0a","resolution":{"observed_at":"2026-08-10T21:56:17.459541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07385","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.086290Z","title":"Logen: Toward lidar object generation by point dif- fusion","venue":null,"work_id":"ee28fb19-3e4e-4c86-9844-f78d9349ede0","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.464824Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:1b8963b62c9f13512d9d660b63fa776214070ede6dfdc97ffd1f0b3ba619f93f","observation_id":"6d0a0da8-d37c-49eb-b21e-6953b82b0639","resolution":{"observed_at":"2026-08-10T21:56:18.096220Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T21:56:17.469966Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.469966Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:89e723358244cfa7ddb4f48bc13d0ee03ab5f666e1fa8ad5652c0686ebbde4c6","observation_id":"469240ef-56a3-4c90-a5d3-0b3fc5e762ac","resolution":{"observed_at":"2026-08-10T21:56:17.469966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.761871Z","title":"Challenges in au- tonomous vehicle testing and validation","venue":null,"work_id":"1e0e7c61-4253-4957-b90c-50ed8d4cc958","year":2016},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.475360Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ae703cec825ff5ac333eb6de565a1fc2a2183977360a7c856adca67f1c97af3b","observation_id":"ce39912a-5252-4f2b-8467-5745d75a6a81","resolution":{"observed_at":"2026-08-10T21:56:18.767748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.744883Z","title":"Efros, and Krishna Kumar Singh","venue":null,"work_id":"caa3db26-c0c5-4b8f-ac1c-69b126690b8c","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.480316Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e23f4dd8e93982ac9fc01fe0fcbe38cf0e721097dee41ecf09aafe166d5d4a98","observation_id":"57ba7a44-af7f-4f18-864f-492a9073bcfb","resolution":{"observed_at":"2026-08-10T21:56:18.750128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.728923Z","title":"Lift3d: Synthesize 3d training data by lift- ing 2d gan to 3d generative radiance field","venue":null,"work_id":"5bdc75b5-e441-4942-b38b-e6ee2088dbe3","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.485834Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:70efe814fc0733797b81470ea21d42d69c4e911d4f87be82c6d707a3fc57df51","observation_id":"305a4560-28a1-47e8-9f8d-6fd3348fcea6","resolution":{"observed_at":"2026-08-10T21:56:18.734014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07771","last_updated":"2023-10-11T18:00:08Z","snapshot_observed_at":"2026-08-01T02:20:23.247164Z","submitted_at":"2023-10-11T18:00:08Z","title":"DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07771","snapshot_observed_at":"2026-08-10T21:56:17.492015Z","title":"Drivingdif- fusion: Layout-guided multi-view driving scene video generation with latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.492015Z"},"links":{"cited_paper":"/paper/2310.07771","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:859db39d5e5d20b94ac2c4cc8fd2be0193ea5426fd329ee8aac37b76fdf4b571","observation_id":"0c6e2faf-b88d-48fc-85af-79861b4d160e","resolution":{"observed_at":"2026-08-10T21:56:17.492015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.713813Z","title":"Exploring geometric consistency for monocular 3d object detection","venue":null,"work_id":"ca155435-910d-4f29-b235-a308ba582ed4","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.497164Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:9a54151ea2c2a1c1c064c34e7f91fe62592772ce540280b2e07728d4c596a92d","observation_id":"1b1ec102-21be-4c96-8731-f664d3ade34e","resolution":{"observed_at":"2026-08-10T21:56:18.718662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.697972Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework, 2022","venue":null,"work_id":"cca3e3b0-c9cd-4cad-816f-dd49c387d652","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.501798Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:78e897de0bafb153466015fd1c7df52360e3bf7132972bf7fb80ffcf8439fcec","observation_id":"8cba1310-bb21-4f93-96b8-83092fb11df3","resolution":{"observed_at":"2026-08-10T21:56:18.703286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14494","last_updated":"2024-12-19T03:39:13Z","snapshot_observed_at":"2026-08-11T12:08:57.945886Z","submitted_at":"2024-12-19T03:39:13Z","title":"Drive-1-to-3: Enriching Diffusion Priors for Novel View Synthesis of Real Vehicles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14494","snapshot_observed_at":"2026-08-10T21:56:17.506321Z","title":"Drive-1-to-3: En- riching diffusion priors for novel view synthesis of real vehi- cles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.506321Z"},"links":{"cited_paper":"/paper/2412.14494","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:04bca96b580ccea08d7f1b6b9127d4c412760b0d0674dd084901b5767a4726d3","observation_id":"bd5ac471-f523-4d4e-a305-bd178c5025ca","resolution":{"observed_at":"2026-08-10T21:56:17.506321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.682692Z","title":"St-gan: Spatial transformer generative adversarial networks for image compositing","venue":null,"work_id":"84c016c6-c681-46ee-8446-9663f574ff11","year":2018},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.511348Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:582fd9c28463952a3f48f28cbb327c085f2ca0e9b42018fbcceb482c71814c1f","observation_id":"4534147c-cd8d-4643-ae89-6b68568a61f3","resolution":{"observed_at":"2026-08-10T21:56:18.687570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09778","last_updated":"2022-10-31T09:05:25Z","snapshot_observed_at":"2026-08-10T13:42:46.496202Z","submitted_at":"2022-02-20T10:37:52Z","title":"Pseudo Numerical Methods for Diffusion Models on Manifolds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09778","snapshot_observed_at":"2026-08-10T21:56:17.515918Z","title":"Pseudo numerical methods for diffusion models on manifolds.arXiv preprint arXiv:2202.09778, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.515918Z"},"links":{"cited_paper":"/paper/2202.09778","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:2e7a708ddfa2733d9cf21ebd308197257b6ef27bcd333f6ff3aea8749b10632b","observation_id":"c4a100ad-469f-47bd-8c4d-59c2b2b75c05","resolution":{"observed_at":"2026-08-10T21:56:17.515918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.520841Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.520841Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:7dea724f673409674c0dfa487442af1cfa567213399ef41e529c789bf95156d1","observation_id":"5cc4de9a-98f5-477b-9760-a1dbc497e3e0","resolution":{"observed_at":"2026-08-10T21:56:17.520841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.655023Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"28a754be-f7b9-4e5c-b8f1-d2b72e647f21","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.526282Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:0555343dff0698c4ce382c585f9a6c9436af100132c419766887b045d27a7431","observation_id":"947cbaf7-2362-426e-be74-cc04beb84f60","resolution":{"observed_at":"2026-08-10T21:56:18.660617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.637849Z","title":"Wovogen: World volume-aware diffusion for con- trollable multi-camera driving scene generation","venue":null,"work_id":"266f119e-ddab-4004-adec-27e270b0f55b","year":2025},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.531152Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:f4d73870ea8b3b4189994219da7585f452be41ec1dbd80f9bd73c7f29c068034","observation_id":"eb6f9c65-cd49-431c-93d1-e6f4b1af338f","resolution":{"observed_at":"2026-08-10T21:56:18.643099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.622403Z","title":"Object 3dit: Language-guided 3d-aware image editing","venue":null,"work_id":"6a54c179-ac60-4992-95aa-173cfc5f08b5","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.535766Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:5dcf357aa20ffe98a156f395f86ea82db83cd7414c161372802c8dcdc50ebd2b","observation_id":"330b05a6-59ac-4f91-bc63-8efbfdb0bec9","resolution":{"observed_at":"2026-08-10T21:56:18.627260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.605828Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"8a437e7e-13c1-4879-a963-210f507ac0a9","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.540178Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:938191949297d754cc72b5613ae90174d01683c5bf74f34368d3c01a69f0fb9f","observation_id":"fafdc0b9-2a18-4561-a9e1-f6b40e99318d","resolution":{"observed_at":"2026-08-10T21:56:18.611089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.589884Z","title":"Lidar data synthe- sis with denoising diffusion probabilistic models","venue":null,"work_id":"5fa09abf-c100-430b-8400-b2358680473f","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.544722Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ae2114fe09957b21a6a4455570a04b31b3e32e79f9bf42567de566a716ddbb2e","observation_id":"53f19588-67f1-4955-ac9b-25a2b6aeee54","resolution":{"observed_at":"2026-08-10T21:56:18.594970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T21:56:17.549185Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.549185Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a3063378cc29d5b6a2aa4f846180b0b1976ebe93047cab0b38348abab3a7749a","observation_id":"c97af81a-6df5-44d2-8414-c288a6e09f4b","resolution":{"observed_at":"2026-08-10T21:56:17.549185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.573586Z","title":"Diffusion handles enabling 3d edits for diffusion models by lifting ac- tivations to 3d","venue":null,"work_id":"0008c4af-4d97-409d-8b7a-985172c3ac56","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.554266Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:7bd9ee9e7c6d080d9dda3afa0562c07e6b1182b206e43d7c11433efbe4f7c74d","observation_id":"f3004938-7190-4940-b9f2-aa7548a7cfea","resolution":{"observed_at":"2026-08-10T21:56:18.579070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.559048Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.559048Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:1aaaa6f2edadea1b630dfe871543ed311049360a7f784aa01bda9ce868b53d30","observation_id":"2a8a809b-dd46-4af4-bcec-c7e84c6a3953","resolution":{"observed_at":"2026-08-10T21:56:17.559048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.546788Z","title":"Towards realistic scene generation with lidar diffusion models, 2024","venue":null,"work_id":"619cc760-5624-401f-aaa9-4d963d282ace","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.563815Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e4064ae3022fa5a53568c659bc46e28251b96163b832147f342aea3490fa2874","observation_id":"d7455579-c92b-463d-b441-42ff75dd0ba9","resolution":{"observed_at":"2026-08-10T21:56:18.552088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.568755Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.568755Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:8ee2843d4af12b3cfcbf72df2212c612d459e043aca35800a374ee17fc1ddf83","observation_id":"beecb48a-36d5-4b79-a2f4-c45bb384afcf","resolution":{"observed_at":"2026-08-10T21:56:17.568755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.517593Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"63ca0aef-a627-4d69-aaaa-764f1ebfd7fb","year":2015},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.573468Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e77cee8c90555e1d3c2889a225741b3f4342bc7c730242caa5175c3806b2c668","observation_id":"90dabf68-a43d-4733-a263-333de67b95c9","resolution":{"observed_at":"2026-08-10T21:56:18.523057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.578145Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.578145Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:dadb199d792238bec3be08331f46d05720d2b78b17e376991f4d04802c8d47e6","observation_id":"222f795f-7ebd-4a5f-8140-c38329b3e780","resolution":{"observed_at":"2026-08-10T21:56:17.578145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.491869Z","title":"Jacobs, and Shlomi Fruchter","venue":null,"work_id":"68b72e93-27fd-43f1-a329-cebae65c51ae","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.582708Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e6d704fb1bbb10c0528385d8269df5f0d2670887d293090eb2aaadd3d924d919","observation_id":"7b9346af-f29a-4326-9a0c-1e3cf40e6e7f","resolution":{"observed_at":"2026-08-10T21:56:18.496931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10722","last_updated":"2024-06-15T19:29:01Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:29:01Z","title":"GenMM: Geometrically and Temporally Consistent Multimodal Data Generation for Video and LiDAR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10722","snapshot_observed_at":"2026-08-10T21:56:17.587143Z","title":"Genmm: Geometrically and temporally consistent multi- modal data generation for video and lidar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.587143Z"},"links":{"cited_paper":"/paper/2406.10722","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:65ac26367092a275efea0574c093ce5b98a5fb07e42b86b212aefd05d0f6ca42","observation_id":"37a1e6ee-553c-432b-8264-148279880619","resolution":{"observed_at":"2026-08-10T21:56:17.587143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.592439Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.592439Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:582c809e1e8e0a30ab0d14d1e8dd65bd108e700a0085282ca48c02cbc397f95d","observation_id":"7ef3ab6c-4993-4be2-98bd-f9fdd66848c1","resolution":{"observed_at":"2026-08-10T21:56:17.592439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.465341Z","title":"Object- stitch: Object compositing with diffusion model","venue":null,"work_id":"f6d92d16-9488-4988-918b-a9e381655e1b","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.597296Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:eac35e1f7d0230dba4b73603b92b9c5706fd2ad124a90d5ecdead0db849ca737","observation_id":"568ec495-6ffc-4b02-af33-562f1e8a35c5","resolution":{"observed_at":"2026-08-10T21:56:18.470970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04504","last_updated":"2024-02-07T01:18:49Z","snapshot_observed_at":"2026-08-09T16:11:22.091315Z","submitted_at":"2024-02-07T01:18:49Z","title":"Text2Street: Controllable Text-to-image Generation for Street Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04504","snapshot_observed_at":"2026-08-10T21:56:17.602604Z","title":"Text2street: Controllable text-to-image gen- eration for street views","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.602604Z"},"links":{"cited_paper":"/paper/2402.04504","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:0169065935b5e68cf38796dcdbb058412438b44cc7217fd43e9b4feb9da8a92e","observation_id":"a0e115f2-baca-4447-ae38-1fe82fbac054","resolution":{"observed_at":"2026-08-10T21:56:17.602604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.449607Z","title":"Neurad: Neural rendering for autonomous driving","venue":null,"work_id":"013d4a16-1b5f-4a58-9f6d-b3711e0201e6","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.608291Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a8a06e045ac645a4c725f407aee898b45a189e3ccbe1c08b506605ee7699c9e8","observation_id":"b7f0b73f-2569-4807-a59f-ad57ab385ce9","resolution":{"observed_at":"2026-08-10T21:56:18.454725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.434306Z","title":"Pointaugmenting: Cross-modal augmentation for 3d object 10 detection","venue":null,"work_id":"dd63e0b1-01a3-401b-842d-d6650bd74ca6","year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.613252Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a55de3cdf798193a0ee1e35e024aae900b9c38c9ab42dff4166fdc0d37dfdab9","observation_id":"599c6803-bec8-40f5-b11f-b33c0c77a246","resolution":{"observed_at":"2026-08-10T21:56:18.439052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01447","last_updated":"2023-11-02T17:56:59Z","snapshot_observed_at":"2026-07-06T16:42:19.938941Z","submitted_at":"2023-11-02T17:56:59Z","title":"CADSim: Robust and Scalable in-the-wild 3D Reconstruction for Controllable Sensor Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01447","snapshot_observed_at":"2026-08-10T21:56:17.618547Z","title":"Cadsim: Robust and scalable in-the- wild 3d reconstruction for controllable sensor simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.618547Z"},"links":{"cited_paper":"/paper/2311.01447","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:64d89ae5a8f7cd345d7b49b310cfec20cd6c60f5bd6d541878ec33b9fa8c1ddd","observation_id":"115f6f95-5471-4827-bfa8-a5ddae4f70af","resolution":{"observed_at":"2026-08-10T21:56:17.618547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.419105Z","title":"Diffusion models are geometry critics: Single image 3d editing using pre-trained diffusion priors","venue":null,"work_id":"2df5aaf0-0818-407c-ae99-c70037c7d97d","year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.623800Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:2b2d5fc00f5077073930a5e6a827f1f25f64bfcbfcbeab3e081825ff12b502f7","observation_id":"0c073766-6195-4621-9bdf-8778ccfbd337","resolution":{"observed_at":"2026-08-10T21:56:18.423916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.404458Z","title":null,"venue":null,"work_id":"cc28037d-8ef4-499c-afad-1294713b3a34","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.629079Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c215f4e52f11ac477e5d2898940cd8bcb8bef1ca84080152cda04af6bcdf6242","observation_id":"999e3ac6-500f-405f-9d76-745c245996f3","resolution":{"observed_at":"2026-08-10T21:56:18.409145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.388078Z","title":"Editable scene simulation for autonomous driving via collaborative llm-agents","venue":null,"work_id":"20d5b606-4e20-46d7-aa91-bb3ed9e455d9","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.633886Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c2bb334031e1240607e9a33a2ad983bbc1b9fb877c6a44dbd6b1a16020862c7a","observation_id":"485b0ec7-a3d4-465a-ac3b-ef7c8ae90c12","resolution":{"observed_at":"2026-08-10T21:56:18.393597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16813","last_updated":"2023-11-28T14:22:24Z","snapshot_observed_at":"2026-08-09T20:53:26.684058Z","submitted_at":"2023-11-28T14:22:24Z","title":"Panacea: Panoramic and Controllable Video Generation for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16813","snapshot_observed_at":"2026-08-10T21:56:17.638566Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.638566Z"},"links":{"cited_paper":"/paper/2311.16813","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:31afe9878b5bd424822f7b8c05359b35dfc204bd9ea905d6ffbfe07254811317","observation_id":"717efe7c-fe03-4adf-a795-f1a0ec67116b","resolution":{"observed_at":"2026-08-10T21:56:17.638566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.370945Z","title":"Objectdrop: Bootstrap- ping counterfactuals for photorealistic object removal and in- sertion, 2024","venue":null,"work_id":"df304c29-3477-4596-a380-da8b31bc6186","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.643562Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:657ae3f15a90698035e6cf5e75a52697331228ca6ee91598bae2aaf3ee293adf","observation_id":"34474a9c-4138-4a52-96e3-3dcda596dad1","resolution":{"observed_at":"2026-08-10T21:56:18.376127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.353323Z","title":"Drivescape: To- wards high-resolution controllable multi-view driving video generation, 2024","venue":null,"work_id":"c1ab40b1-af05-4eb9-994b-da677a796cfc","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.648768Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:159dd792c97306a342c2e7066ff7c7a01495641a9d3cc7ebf27de056919bba94","observation_id":"be6f34f1-6593-483f-ab7a-ef1d941dd7d6","resolution":{"observed_at":"2026-08-10T21:56:18.358909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09292","last_updated":"2024-10-28T23:42:11Z","snapshot_observed_at":"2026-08-10T04:20:42.509197Z","submitted_at":"2024-06-13T16:29:18Z","title":"Neural Assets: 3D-Aware Multi-Object Scene Synthesis with Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09292","snapshot_observed_at":"2026-08-10T21:56:17.654761Z","title":"Neural assets: 3d-aware multi-object scene synthesis with image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.654761Z"},"links":{"cited_paper":"/paper/2406.09292","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:14cfe2d3aeb9ad8fea53b74a6b2af71fa652f3e98a66520bb27fbb7c52842e2f","observation_id":"49e66a03-0e25-4810-a4aa-ed2458aeffa1","resolution":{"observed_at":"2026-08-10T21:56:17.654761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.336103Z","title":"Synthetic lidar point cloud generation using deep gen- erative models for improved driving scene object recogni- tion","venue":null,"work_id":"0b17e37e-7e15-40eb-8143-99a351d61d86","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.660051Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:0da8aad95d7454d5020ac476cad94fe1626b4bfb3ec720e31d3bb24f2b3ca773","observation_id":"03fbc3cc-656a-4eb3-8746-be76fdde7f8c","resolution":{"observed_at":"2026-08-10T21:56:18.341392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01123","last_updated":"2024-11-02T03:52:12Z","snapshot_observed_at":"2026-08-09T16:38:52.781391Z","submitted_at":"2024-11-02T03:52:12Z","title":"X-Drive: Cross-modality consistent multi-sensor data synthesis for driving scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01123","snapshot_observed_at":"2026-08-10T21:56:17.665000Z","title":"X-drive: Cross-modality consis- tent multi-sensor data synthesis for driving scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.665000Z"},"links":{"cited_paper":"/paper/2411.01123","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:b0de439fc181c2229485aff8977511815257210afe9e46b1375cef00c6f3633a","observation_id":"c5a06afd-1698-42a5-8614-2d27e2250f53","resolution":{"observed_at":"2026-08-10T21:56:17.665000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.320632Z","title":"Ultralidar: Learning compact representations for lidar completion and generation, 2023","venue":null,"work_id":"f6fd3865-54ff-4bb0-a7b4-731d124ab3a8","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.670311Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:bbcc1998f7247d9f6fd2fdee282ca9960ff327a2ca7ac14f5025c9d4b6ad695a","observation_id":"288e9a4c-977f-4364-ba3f-b1a77c14b761","resolution":{"observed_at":"2026-08-10T21:56:18.325513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.304591Z","title":"Second: Sparsely embed- ded convolutional detection","venue":null,"work_id":"1641b3ae-d093-4058-a9b2-5f8277157544","year":2018},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.675148Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:30e31f0702788829e97ca9f98ee48a06ee8d95996356e3733831f04038a838ba","observation_id":"b831dfac-4cf9-4b0a-85b1-23889abe4ff3","resolution":{"observed_at":"2026-08-10T21:56:18.309824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.680003Z","title":"Paint by example: Exemplar-based image editing with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.680003Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:391262e86638ba3a2e4ba59b86d8920b48354a596a6f1d958678614325f443d3","observation_id":"213ebdca-53de-46ac-8a36-3dc3c9b00eb3","resolution":{"observed_at":"2026-08-10T21:56:17.680003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01661","last_updated":"2023-09-23T06:59:18Z","snapshot_observed_at":"2026-08-10T15:06:41.781578Z","submitted_at":"2023-08-03T09:56:31Z","title":"BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01661","snapshot_observed_at":"2026-08-10T21:56:17.685225Z","title":"Bevcontrol: Accurately controlling street- view elements with multi-perspective consistency via bev sketch layout","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.685225Z"},"links":{"cited_paper":"/paper/2308.01661","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:6c9e7569daf5232ecd7ecadb3a7b87d08c21028a998358e8ee8a47be79408189","observation_id":"4859d704-e15c-442a-9548-35b8abd91afb","resolution":{"observed_at":"2026-08-10T21:56:17.685225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.690608Z","title":"Unisim: A neural closed-loop sensor simulator","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.690608Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:f0a03fe12a5021aa1f68c47c7f600fd02424785d2d10deacf4be72c286b18f9e","observation_id":"50ea3ab9-1c21-4998-80da-c29459aa7a8e","resolution":{"observed_at":"2026-08-10T21:56:17.690608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.695789Z","title":"Image sculpting: Precise ob- ject editing with 3d geometry control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.695789Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a47dce971714d57b452ebe6a2f5126aa304acaade702d7613b6b2a52d48d772c","observation_id":"8a159840-ff0e-4713-a2d8-732730d85113","resolution":{"observed_at":"2026-08-10T21:56:17.695789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19784","last_updated":"2023-12-07T15:22:07Z","snapshot_observed_at":"2026-08-10T19:43:11.409087Z","submitted_at":"2023-10-30T17:50:14Z","title":"CustomNet: Zero-shot Object Customization with Variable-Viewpoints in Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19784","snapshot_observed_at":"2026-08-10T21:56:17.700708Z","title":"Customnet: Zero-shot object customization with variable-viewpoints in text-to-image dif- fusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.700708Z"},"links":{"cited_paper":"/paper/2310.19784","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:182fc82ec6437bf0b6c5be5a7ad97a6f11702d388c799c83834a04d7825e7dce","observation_id":"71297ca1-1fc4-4c5e-aa62-82bc5664404c","resolution":{"observed_at":"2026-08-10T21:56:17.700708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.705609Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.705609Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:b8f8c79dc5e29980cd96d1fbaed29f6ff2519ea8ebec9db11b5c20c6e249d4e6","observation_id":"dd182fbb-1323-4358-8e89-a5c0f121f271","resolution":{"observed_at":"2026-08-10T21:56:17.705609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.246786Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"7c2dfc7e-a20e-4947-bc57-d93240d50e81","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.710394Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:cb1bd8543a691a862aa90a406db283c330896145e1c078bfa3ac2af15a7d0880","observation_id":"d401580e-7a4f-49cf-8029-b6641e72d82a","resolution":{"observed_at":"2026-08-10T21:56:18.252192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.714885Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.714885Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:b555bb9001c50845dbbf06c51b37f494f87a5ed9784c8b6c95e252c1f791c564","observation_id":"5948a2db-566b-478e-9d15-69a47fb94106","resolution":{"observed_at":"2026-08-10T21:56:17.714885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12741","last_updated":"2021-04-21T16:23:20Z","snapshot_observed_at":"2026-08-07T09:23:25.072430Z","submitted_at":"2020-12-23T15:23:16Z","title":"Exploring Data Augmentation for Multi-Modality 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12741","snapshot_observed_at":"2026-08-10T21:56:17.719381Z","title":"Explor- ing data augmentation for multi-modality 3d object detec- tion","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.719381Z"},"links":{"cited_paper":"/paper/2012.12741","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:1dfde717ddc9efe37a79eb0c820c0fbec530ebf630dfbe210370a55c65cd469b","observation_id":"87f578b1-96b1-48c8-a829-cbbe8dd1c479","resolution":{"observed_at":"2026-08-10T21:56:17.719381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12419","last_updated":"2025-05-01T12:58:23Z","snapshot_observed_at":"2026-08-10T18:28:53.724775Z","submitted_at":"2023-12-19T18:50:33Z","title":"Scene-Conditional 3D Object Stylization and Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12419","snapshot_observed_at":"2026-08-10T21:56:17.724151Z","title":"Scene-conditional 3d object stylization and compo- sition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.724151Z"},"links":{"cited_paper":"/paper/2312.12419","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:0dcbd5b5ab51655c534dc60c35f899583fc9ced9b557fa0d2d24f57731b53954","observation_id":"91af7488-f78d-4083-b10b-2e4b0d54dfd9","resolution":{"observed_at":"2026-08-10T21:56:17.724151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.220598Z","title":"Learning to generate realistic lidar point clouds, 2022","venue":null,"work_id":"dd6e3655-f680-49ec-93fb-4c4c76544f67","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.729124Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ef49b3cf45dbc0ce8c5052ae4c2ca5a5f78f9e6cf358fb0cbe3f019b628e6f74","observation_id":"773076ce-60f6-4c5b-b9f5-e615be42e263","resolution":{"observed_at":"2026-08-10T21:56:18.225686Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T00:28:55.974634Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2501.03173."}