{"as_of":"2026-08-05T14:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93ef59a2b54aee08c4b8db8c3c5d2390c8fcda27784b940f0f0c839fda3580ae","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T11:02:32.366050Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.18599/citation-record","integrity":"/paper/2605.18599/integrity","json":"/paper/2605.18599/citation-record.json","paper":"/paper/2605.18599"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.02732","last_updated":"2025-08-05T16:43:21Z","snapshot_observed_at":"2026-07-06T21:03:45.452337Z","submitted_at":"2025-04-03T16:17:55Z","title":"Why do LLMs attend to the first token?","version":4},"cited_work":{"arxiv_id":"2504.02732","doi":"10.48550/arxiv.2504.02732","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why do llms attend to the first token?","venue":"arXiv (Cornell University)","work_id":"298dab4e-c69c-4720-af0e-c20f50c58b39","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2504.02732","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:a8a20adc5d4b7a96f688680f53b0b84a7eedbfc086e6063a199ba41c79ed7719","observation_id":"00287fab-c86d-4052-adec-585b18c64da9","resolution":{"observed_at":"2026-05-20T11:03:13.394408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":"2302.12288","doi":"10.48550/arxiv.2302.12288","metadata_source":"pith","pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","venue":"cs.CV","work_id":"c902e427-c54a-4fc4-8aef-d0243f90ea39","year":2023},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:be737226531f5eea09257268ab77299db02f4021e2cee299a2230bd0f976ddf7","observation_id":"9ff54779-9354-4f44-b859-c90d28e5c87d","resolution":{"observed_at":"2026-05-20T11:03:13.385685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":"2410.02073","doi":"10.48550/arxiv.2410.02073","metadata_source":"pith","pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","venue":"cs.CV","work_id":"0b67883b-1901-45f1-9d58-1ef7a928df23","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:0cd605e15421f3b333f079123de79a964a7e65cd6de8ae82d6a089e2e60fc177","observation_id":"ba2a9cc1-0985-4f04-9262-32331a54ddd3","resolution":{"observed_at":"2026-05-20T11:03:13.377168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T22:24:11.365203Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"e103ff68-05af-4a7e-a0d9-064a1e39b29b","year":2021},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:11438399eb45ca1c6e2b1cc2746bab58677cbd9b9aeddfc1029f5e36d94448a4","observation_id":"48622f9c-6b42-4cf6-962e-fb1e2feb48b0","resolution":{"observed_at":"2026-05-20T11:03:14.279218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvsnerf: Fast generalizable radiance field reconstruction from multi-view stereo","venue":null,"work_id":"6a6ade36-12e8-4cfe-9cfe-6d10a8637fe8","year":2021},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:d02a9ce8a4f858bdd9583b7b5cbe7bc0597ebdfbab16a45938149b26b6dd4c37","observation_id":"c3c38450-b47a-40e6-a496-bdf09fd6620b","resolution":{"observed_at":"2026-05-20T11:03:14.277404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T22:04:07.856338Z","title":"Vision transformers need registers","venue":null,"work_id":"94a533bd-129f-4df0-b587-d1bfda846764","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:6da92a20ea625994c2c770294341497014fdae0b83be4e43304de1015bd7e61c","observation_id":"6f9ab943-8c32-4667-9cb6-87b7fd12e13c","resolution":{"observed_at":"2026-05-20T11:03:14.295773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling and rendering architecture from photographs: A hybrid geometry- and image-based approach","venue":null,"work_id":"c08fbfd1-8aa7-442b-bf76-3aca220b1042","year":1996},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:5bcfa4f0498629465c3f142ae1cfa88cbb434fb9029cd063af5e03742d30e438","observation_id":"bab7f648-9514-4c95-9f1e-24165fa07026","resolution":{"observed_at":"2026-05-20T11:03:14.297785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"08870729-eb23-4c7e-93a4-d893371baf7e","year":2023},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:136bb0909d22359f988f3412e0991721833fdf490e878d9ea86be71b5f740057","observation_id":"6dc734b2-7b27-4cde-9b8c-51a35d46f564","resolution":{"observed_at":"2026-05-20T11:03:14.299617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:15:39.509045Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"d1d5658f-0fdf-4699-b033-af2d334a74fb","year":2021},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:c346bda9772ea63b4df5b081fa90f1ca557827782db5a3a6070a5e9bd44cc723","observation_id":"49d69f18-fdbf-4ea3-8fb8-601e85ba6f77","resolution":{"observed_at":"2026-05-20T11:03:14.301709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lrm: Large reconstruction model for single image to 3d","venue":null,"work_id":"3dc2a714-bde2-4361-b31a-0bbb0743c450","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:46cb8f8165d5e118077b23948dbd7c147bae82d90566c8b2661246851dc17f1c","observation_id":"d67e2a67-a66d-49e6-b9f7-cc471c4d99e5","resolution":{"observed_at":"2026-05-20T11:03:14.303435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:43:15.107344Z","title":"Efficient-lvsm: Faster, cheaper, and better large view synthesis model via decoupled co-refinement attention","venue":null,"work_id":"7a002cde-7b76-4368-915b-9bc66753cca7","year":2026},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:f51aed05ea7c7331c0010bdc74759f1ddec473873dc70c5016108ab81052c747","observation_id":"cd8f46ea-595e-48d9-9fa2-84e7a297a77d","resolution":{"observed_at":"2026-05-20T11:03:13.371895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00702","last_updated":"2025-05-01T17:59:34Z","snapshot_observed_at":"2026-07-06T21:17:42.853055Z","submitted_at":"2025-05-01T17:59:34Z","title":"RayZer: A Self-supervised Large View Synthesis Model","version":1},"cited_work":{"arxiv_id":"2505.00702","doi":"10.48550/arxiv.2505.00702","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00702","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rayzer: A self-supervised large view synthesis model","venue":"arXiv (Cornell University)","work_id":"3371788e-0793-4cd4-a9fb-abe1551c48b3","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2505.00702","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:9e9e7666baff40deef3ac27d422f9d2c9ab8654b2bd17f130e2782763aef2b5a","observation_id":"aba8a388-22e2-404f-ba27-62ae7f923bd8","resolution":{"observed_at":"2026-05-20T11:03:13.366493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lvsm: A large view synthesis model with minimal 3d inductive bias","venue":null,"work_id":"4f181d03-f220-4eed-9dbf-3f2c871f9ff7","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:a49dda3df25491d7f1291ec7a25eb8ef053d802080e13d4d09c00041ab6369b0","observation_id":"c82c8560-8f14-481f-8056-eded1b322197","resolution":{"observed_at":"2026-05-20T11:03:14.275595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":"cc7ab686-d48f-4458-80ef-76f4034c098b","year":2016},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:bdbb026f4757fdad6895842ad6f2ae0a6872cfb1ac149360091ab0ab4853c019","observation_id":"98c5dd99-64f5-4c3f-8cd7-25bd9564b2d2","resolution":{"observed_at":"2026-05-20T11:03:14.291841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23277","last_updated":"2026-05-31T07:54:18Z","snapshot_observed_at":"2026-08-03T13:53:25.033654Z","submitted_at":"2025-07-31T06:33:07Z","title":"iLRM: An Iterative Large 3D Reconstruction Model","version":3},"cited_work":{"arxiv_id":"2507.23277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23277","snapshot_observed_at":"2026-07-09T18:46:26.558790Z","title":"ilrm: An iterative large 3d reconstruction model","venue":"cs.CV","work_id":"74ec4c46-ffc1-4fac-b6b8-795009a06260","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2507.23277","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:96c8b251ad03bd53c626cb7ef5d901ddc82d114506b16f8397c18d8ea2d9b97e","observation_id":"87953b34-6767-4707-90fe-fd4205efaef1","resolution":{"observed_at":"2026-06-02T02:04:07.386055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Transactions on Graphics (TOG), 42(4): 1–14","venue":null,"work_id":"2cf5440a-4c91-420b-bd97-79586a89c62d","year":2023},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:bbebdb2e9d023ef0b6a7cf7e226c0efd392570dbf7753924a66d22fe15e1faae","observation_id":"cfecd887-1470-4fc4-a0d6-20b1271495e2","resolution":{"observed_at":"2026-05-20T11:03:14.286960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Giese, M","venue":null,"work_id":"85e40796-ebe0-4118-83f5-399b1373addd","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:2275714f50e3ec749191294da69fb8e94cf838fdf58b47f9a8a384845daeba4a","observation_id":"5c49d04e-b915-4064-b981-c67b042f9120","resolution":{"observed_at":"2026-05-20T11:03:13.363713Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.10483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:32.237292Z","title":"Repa-e: Unlocking vae for end-to-end tuning with latent diffusion transformers","venue":null,"work_id":"4ad471a0-3426-4e98-818c-cb238de280a9","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:7a2d2f5f507808ece8967e568b386337150d1d371fa5c9608e5f45c3aa098f97","observation_id":"076073ce-50ce-47c3-b689-b4c922de2a04","resolution":{"observed_at":"2026-05-20T11:03:13.388685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":"2511.10647","doi":"10.48550/arxiv.2511.10647","metadata_source":"pith","pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","venue":"cs.CV","work_id":"0a54b500-1e9d-46c2-85eb-8e16cbac8461","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:abbdffa890ae0134f23a47e90d407bc75ceb7e568391b4abc97c42deb797ee49","observation_id":"7eadee0a-dd9b-4da3-8e2c-93448639adfd","resolution":{"observed_at":"2026-05-20T11:03:13.369120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04236","last_updated":"2026-05-03T04:02:22Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T15:03:31Z","title":"Scaling Sequence-to-Sequence Generative Neural Rendering","version":3},"cited_work":{"arxiv_id":"2510.04236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.04236","snapshot_observed_at":"2026-07-01T22:16:16.441802Z","title":"Scaling Sequence-to-Sequence Generative Neural Rendering","venue":"cs.CV","work_id":"4301970b-87b8-4c67-9a86-820c38b71ffe","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2510.04236","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:25cc18ff7d0f4bb8e7058f85c3e956d05b33e21b8e952f26d862140cee5a8a36","observation_id":"97b843e0-e457-4021-9901-b330135ebdc2","resolution":{"observed_at":"2026-05-20T11:03:13.357943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.924579Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"a1e3c974-0c48-43bd-8f29-52f24e5371c5","year":2019},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:8ff9c1b62d8e9803c2060698a1b084da24b095bd3d1fda8c82ca903d5491eaed","observation_id":"1d913046-b70f-47d3-a3d0-38d7097e642c","resolution":{"observed_at":"2026-05-20T11:03:14.285067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:38:19.487637Z","title":"Revisiting [cls] and patch token interaction in vision transformers","venue":null,"work_id":"6baed6c5-89e0-462a-90b3-e23dfedca401","year":2026},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:e5f5f42a4a8e8f9a4dc1d224e464789ec0ef5c751fd4aad3374a8612b85716d4","observation_id":"1416acf9-102e-436f-95b5-d9746f46abfa","resolution":{"observed_at":"2026-05-20T11:03:13.374459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":"819f3b71-6ad0-45ef-bdfe-3176d27d8f3a","year":2020},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:5128e8f68c82372fd14f7b29ef2ed2d38ffdcda89dd79a6d6481dbcc887d96e6","observation_id":"4fd1bec4-fc2a-4ce8-ab85-e03b077930eb","resolution":{"observed_at":"2026-05-20T11:03:14.289830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:035fa497a2db692b1656575075c097f7e73a94d72ef7f94df09a8ceb44f47870","observation_id":"e202dd69-0974-4a16-b443-c24e1ddf6f20","resolution":{"observed_at":"2026-05-20T11:03:13.391323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FiLM: Visual reasoning with a general conditioning layer","venue":null,"work_id":"ddf79ca1-68b5-4553-a3ff-8489be3e6dc0","year":2018},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:497504746ef60849b78be962d85c7cd11a8dc7899e59d0de1fa508243baf58ba","observation_id":"e1cb049c-76f1-4c19-8dc3-a132a52f7575","resolution":{"observed_at":"2026-05-20T11:03:14.293632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On a new geometry of space.Philosophical Transactions of the Royal Society of London, 155:725–791","venue":null,"work_id":"e495fa84-8189-44f6-8b4d-1639d4d11b2a","year":null},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:54d8f956e848f2f21fcf90502aa095522ad61b55b0ecd1160965d8739dd499fb","observation_id":"40b5e5ae-1936-4340-be82-7a3ca64f96d2","resolution":{"observed_at":"2026-05-20T11:03:14.283039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising vision transformers","venue":null,"work_id":"5719d53b-e160-4c29-a579-07eb61afa851","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:f410dc89fa19a449427aeda1950b91077b90b991292bc7c374e51377ad1fbe12","observation_id":"22b77ff7-216f-44ab-847f-40c017102167","resolution":{"observed_at":"2026-05-20T11:03:14.281017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:9d9ace8951e6a3a591bbdf6e1e5bcb1f0d8bd64038262fee3b7591e6aa228cb0","observation_id":"7ef25d62-0879-427d-bbaf-16d215fa897d","resolution":{"observed_at":"2026-05-20T11:03:13.382943Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:59:58.043629Z","title":"What matters for representation alignment: Global information or spatial structure?","venue":null,"work_id":"f1f54511-fa19-44c2-9a85-6b1016b6d627","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:86a6cb93d030a54a567db53d8406c3f9c94f0de50536dda940cfd2160edeb2f6","observation_id":"47cdbc06-7fe9-4f3e-a072-7c35dea5887f","resolution":{"observed_at":"2026-05-20T11:03:13.400354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.18414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T23:57:27.837768Z","title":"U-repa: Aligning diffusion u-nets to vits","venue":null,"work_id":"371c7caa-d9d9-4291-a7b7-b3125dd8d19c","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:ea5480253fda007abf5c7abac0b86cecb13fa578a502be639a986763da5ef8ac","observation_id":"54e036b6-a8fc-48de-8bfe-34d7c147b8d0","resolution":{"observed_at":"2026-05-20T11:03:13.417057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Least-squares estimation of transformation parameters between two point patterns.IEEE Transactions on Pattern Analysis and Machine Intelligence, 13(4):376–380","venue":null,"work_id":"9e64c89a-9983-4903-b85d-2f3aa80e0527","year":null},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:5efe74dfb5d198422591316e9acbb8032413dffb4112b21c08035b7554e8619b","observation_id":"bd7326a6-76f8-4fa2-a97d-eedd084bd3d3","resolution":{"observed_at":"2026-05-20T11:03:14.318847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/34.88573","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Least-squares estimation of transformation parameters between two point patterns","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"b0c34a24-3ccf-4972-a8d7-be64735dec6e","year":1991},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:7a9aae2d0e17858442be4dedba60f3e0fbe6e5c24b58b3a10bdc5b3c2800c474","observation_id":"5ca670f2-0a6b-4d0a-9eec-c4986391dbec","resolution":{"observed_at":"2026-05-20T11:03:13.075336Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:46.039364+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:46.039364+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ibrnet: Learning multi-view image-based rendering","venue":null,"work_id":"15ee0844-d251-44b0-a6ef-2cf72b0b359e","year":2021},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:1eedfd7391c9ac2fb42ba34c5238ae6106566b2eb8905e9a1398b2d2346079ee","observation_id":"fab1072b-f118-4f7a-9334-692452551089","resolution":{"observed_at":"2026-05-20T11:03:14.322636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19115","last_updated":"2025-04-15T06:33:45Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T19:29:02Z","title":"MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision","version":3},"cited_work":{"arxiv_id":"2410.19115","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19115","snapshot_observed_at":"2026-07-10T01:46:41.316792Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":"cs.CV","work_id":"f448b8f3-4ea5-46af-a336-f7953b2dfb17","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2410.19115","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:a7d5505c8576f1591c380d786646d5b9c603a08fdf819a70d2e7a7bac6fbbd62","observation_id":"7d038493-3233-495f-9437-2f65bceb0e69","resolution":{"observed_at":"2026-05-20T11:03:13.408956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":"e733f15c-85e2-44b3-bb35-b92db8e09c4e","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:1bf0df57f6f66bcd13945d75cd9bafb3995026731ae84c7d802364fa2016392c","observation_id":"50966bdf-5016-4c73-b667-99ba402ca26d","resolution":{"observed_at":"2026-05-20T11:03:14.316826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image quality assessment: From error visibility to structural similarity.IEEE Transactions on Image Processing, 13(4): 600–612","venue":null,"work_id":"9a5468f5-c52c-41ab-8375-208f2de404a9","year":2004},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:fc2fee19cea5b3ee349bd85a53bc5ba0c5bef164403059f8c971c0a093eb108b","observation_id":"dc557af4-5b39-4208-9799-5e0168089cc2","resolution":{"observed_at":"2026-05-20T11:03:14.312985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T09:45:39.672572Z","title":"From rays to projections: Better inputs for feed-forward view synthesis","venue":null,"work_id":"693e191b-0fb9-448d-a33b-66c4c507e5f7","year":2026},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:843bde56dd9259addf941c4ce9569f5ab583a55296c7de6d742d462592da9976","observation_id":"35165ec0-430b-4f96-a2dc-04b3241928a2","resolution":{"observed_at":"2026-05-20T11:03:13.411606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:20.221846Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"905d6ec4-1fb2-4ece-aaf9-818fb257fb22","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:d993bac3b788057b7386abcc99cce65a2e0d25ae080466e04c251e7a435725ed","observation_id":"3018a865-42e9-4103-8628-5d3826ec9d15","resolution":{"observed_at":"2026-05-20T11:03:14.311099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":"2406.09414","doi":"10.48550/arxiv.2406.09414","metadata_source":"pith","pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Depth Anything V2","venue":"cs.CV","work_id":"5f5274d6-f7a5-4598-a3f6-d11f44520a2e","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:5b29ca5f091b6a3f61470d12b1f825fbf9d46f963922fdace738121765ea8deb","observation_id":"8055545f-74f3-4d2d-9b94-bd2c3dce50e9","resolution":{"observed_at":"2026-05-20T11:03:13.414179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"pixelnerf: Neural radiance fields from one or few images","venue":null,"work_id":"2e3379af-abbc-4a09-9a7f-01d9f6a73689","year":2021},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:c04260d0b901c03c92a6582fe564a9b80dd20480341e931b866647652bfcbc19","observation_id":"03a1c0b0-920c-4b73-b6ec-fb856f0348ae","resolution":{"observed_at":"2026-05-20T11:03:14.315017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:6fd49f2948fd9ac9a0e50f3e2c4330e84e5f0c32ffea6096e8015d7786d37589","observation_id":"4ce068ef-02ac-4c25-98a9-27985a497580","resolution":{"observed_at":"2026-05-20T11:03:13.405757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gs-lrm: Large reconstruction model for 3d gaussian splatting","venue":null,"work_id":"e9fa96dd-6230-4b5c-b74c-6b36dd16e071","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:63d93c4344eca3337c224822bcecf0f4815ef0ed6e5afa8eeeec6a28a43689cf","observation_id":"0a408cc8-31ff-4143-93cd-b62fc8847ede","resolution":{"observed_at":"2026-05-20T11:03:14.307357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unrea- sonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"664b31f5-577c-48f8-a344-8fdf2801566c","year":2018},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:2dd86d9213f9b7cb16428fa4d5ee3f904b203591dbe2e1ee0fa8b2996ca69d61","observation_id":"cbd41d1a-835c-42f3-903d-4361670a4224","resolution":{"observed_at":"2026-05-20T11:03:14.305242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:89241b64d7327fdb6c0acc61d583f11d27f7aa48fcae7ac45617fc28077353ff","observation_id":"819e58c0-308b-4a8b-8e3f-a20492ce18be","resolution":{"observed_at":"2026-05-20T11:03:13.380279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14489","last_updated":"2025-04-01T18:22:54Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:22Z","title":"Stable Virtual Camera: Generative View Synthesis with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2503.14489","doi":"10.48550/arxiv.2503.14489","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14489","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arc left","venue":null,"work_id":"72bba5bf-fe95-4b18-8c99-5742ab45bc25","year":2025},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2503.14489","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:2bfd7995e9bffcd975a40cb7c4a32c6b34fd893aa559cf728031c16e61e1cd56","observation_id":"56d1c465-0cee-4126-b41f-774e5fc1258b","resolution":{"observed_at":"2026-05-20T11:03:13.397259Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stereo magnifi- cation: Learning view synthesis using multiplane images","venue":null,"work_id":"57edf717-bd4f-49df-bd63-8d92fbe545e0","year":2018},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:b1894fb5e45c941d71a0b9b9ec9d0e9e2dcd26fcf41f2067916d50e4efee426c","observation_id":"ef83b941-48e0-4f4c-bd5b-ccfb4c721419","resolution":{"observed_at":"2026-05-20T11:03:14.320714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12781","last_updated":"2025-08-01T04:29:18Z","snapshot_observed_at":"2026-08-02T12:28:39.135637Z","submitted_at":"2024-10-16T17:54:06Z","title":"Long-LRM: Long-sequence Large Reconstruction Model for Wide-coverage Gaussian Splats","version":2},"cited_work":{"arxiv_id":"2410.12781","doi":"10.48550/arxiv.2410.12781","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12781","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Ziwen, H","venue":null,"work_id":"72962c56-efd5-4461-9a60-095daf196493","year":2024},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"cited_paper":"/paper/2410.12781","citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:cddaf79868ca71eb1e42a2ec84dbbe5c299bc13855b397e5766d5a361a2034d6","observation_id":"507df643-b2b0-4681-b660-b98571531f28","resolution":{"observed_at":"2026-05-20T11:03:13.403020Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"4dbd964e-314e-4fba-960e-b6e17d04d3bc","year":null},"citing_paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T11:02:32.366050Z"},"links":{"citing_paper":"/paper/2605.18599"},"observation_digest":"sha256:6a2bd3eedc05184d69b065d5b86732022be8048a1e5d473a543ac2b9a3c09a96","observation_id":"b646ad1e-d69b-4eca-b0ca-1d0ab530a8c1","resolution":{"observed_at":"2026-05-20T11:03:14.309251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18599","last_updated":"2026-05-18T16:09:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T11:31:17.179504Z","submitted_at":"2026-05-18T16:09:52Z","title":"Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":19,"verified_fuzzy":25},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2605.18599."}