{"as_of":"2026-08-07T18:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:539b45b4fabdd910b54169e66022282c3dad5997b5159669031818476ccf8f8f","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:02:50.657028Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:55:30.013860Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:37:36.442163Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2604.18747","last_updated":"2026-06-30T00:24:29Z","snapshot_observed_at":"2026-07-06T23:05:30.879164Z","submitted_at":"2026-04-20T18:52:03Z","title":"URoPE: Universal Relative Position Embedding across Geometric Spaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T04:17:10.806446Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2604.18747"},"observation_digest":"sha256:9d9017f8866964e95e03b0fe37a80879f1f858bc9a770afbecb088109a9fd65f","observation_id":"312da80c-c5eb-4cdb-bf33-492dca4f6816","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2605.12938","last_updated":"2026-05-13T03:18:26Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T03:18:26Z","title":"CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T20:07:28.493050Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2605.12938"},"observation_digest":"sha256:d4167cf44f14e06b81770c0d41fc94c668fe0db1b699dd7064f698d293f392cc","observation_id":"02c3a83e-ae25-4dea-94c7-e916896181f5","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2606.01590","last_updated":"2026-06-01T02:37:56Z","snapshot_observed_at":"2026-08-02T14:53:31.726245Z","submitted_at":"2026-06-01T02:37:56Z","title":"Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:33:51.064212Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.01590"},"observation_digest":"sha256:6ed9ef55e56766a92a0059d5dc9fff44815d5e32bb7eea324bcdc828eb46c260","observation_id":"131d7a36-4001-48b2-a55d-5a48eebea1c8","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2606.11275","last_updated":"2026-07-18T15:27:47Z","snapshot_observed_at":"2026-08-07T09:37:04.875624Z","submitted_at":"2026-06-09T09:56:50Z","title":"RoVE: Rotary Value Embeddings Attention for Relative Position-dependent Value Pathways","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T13:50:51.534798Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.11275"},"observation_digest":"sha256:ad5cd04d3e8f5a8b98d60f07e1030eb153df2badec5def6743e6f8ed609ba4fe","observation_id":"b6b4f42a-5282-4ff8-b001-17749fdb66c0","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-08-02T11:55:30.013860Z","title":"arXiv:2601.15275 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11275","last_updated":"2026-07-18T15:27:47Z","snapshot_observed_at":"2026-08-07T09:37:04.875624Z","submitted_at":"2026-06-09T09:56:50Z","title":"RoVE: Rotary Value Embeddings Attention for Relative Position-dependent Value Pathways","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T11:55:30.013860Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.11275"},"observation_digest":"sha256:f28340433ef85e0bf98a328b6e04e2deb99bd831db87d0c3bfd93c5b49b59701","observation_id":"ab1c3669-0f78-42d4-bbb0-5b7e41c03823","resolution":{"observed_at":"2026-08-02T11:55:30.013860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2606.31585","last_updated":"2026-06-30T12:38:58Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:38:58Z","title":"DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:39:21.642584Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2606.31585"},"observation_digest":"sha256:ba174f4fa39018f6d3aaf0d045050c0253214350131f21ea1dfdc7b425e85e30","observation_id":"3b575bb8-b795-41f3-8932-a8909489c1dd","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":"2601.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-07-08T02:18:10.671919Z","title":"Rayrope: Projective ray positional encoding for multi-view attention","venue":null,"work_id":"51636ad9-ac46-4382-bea0-d73080115ee4","year":2026},"citing_paper":{"arxiv_id":"2607.00417","last_updated":"2026-07-01T04:19:49Z","snapshot_observed_at":"2026-08-07T01:39:57.542610Z","submitted_at":"2026-07-01T04:19:49Z","title":"EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-02T15:18:22.366989Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2607.00417"},"observation_digest":"sha256:ae287429cb040096198d8115714955b19d86d32a9279bcac7afc0704d2f6e5d3","observation_id":"9d2d883d-7233-476a-aeff-263f0d4f09e6","resolution":{"observed_at":"2026-07-08T02:18:10.671919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15275","snapshot_observed_at":"2026-08-01T22:41:46.318816Z","title":"Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Bang Zhang, and Song-Hai Zhang","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15667","last_updated":"2026-07-17T06:22:14Z","snapshot_observed_at":"2026-08-06T18:34:46.999623Z","submitted_at":"2026-07-17T06:22:14Z","title":"PE-Field 4D: Video Generation Models as Canvas","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T22:41:46.318816Z"},"links":{"cited_paper":"/paper/2601.15275","citing_paper":"/paper/2607.15667"},"observation_digest":"sha256:bd5d1b297d86c6e948f4365816386b4e22847506f7245b1a19bdf5b4cd2fc240","observation_id":"aaee9967-1a0a-4fb3-bccf-7bfb9331e625","resolution":{"observed_at":"2026-08-01T22:41:46.318816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.15275/citation-record","integrity":"/paper/2601.15275/integrity","json":"/paper/2601.15275/citation-record.json","paper":"/paper/2601.15275"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.577542Z","title":"Ac3d: Analyzing and improving 3d camera control in video diffusion trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.577542Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:129ccd5e2e6d2badea9cd18ae8d0654ea4a1f2894d7fbbdad09c37ab113ac5ae","observation_id":"4fedc77d-b6bb-47d8-bc17-916776865a1d","resolution":{"observed_at":"2026-08-03T09:02:46.577542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.657427Z","title":"Positional encoding field.arXiv preprint arXiv:2510.20385, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.657427Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:d975bbb7c4f849e402e2ac02cd9edbfd9f20fa6a44ae86cb07e93bfb0e593552","observation_id":"0f8ed8ab-8de0-43eb-9630-f6babb855e9e","resolution":{"observed_at":"2026-08-03T09:02:46.657427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.701881Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.701881Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:6523e94f9ca097657b7ed6209ab63e34506a232f5f14d1f11cfdbf200c180a69","observation_id":"ff66e488-d1f7-4da3-9654-e54746f473cf","resolution":{"observed_at":"2026-08-03T09:02:46.701881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.809149Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.809149Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:4c7d61b68ab92364b66a3504e17278b4edd7e10f88ae0c484135b2dada30bc08","observation_id":"0508169d-f037-4e9d-b217-b1d6d8c7371f","resolution":{"observed_at":"2026-08-03T09:02:46.809149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:46.974936Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:46.974936Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:8941ff160da98d505768e3f0dee515ba52382b927080e547fd767aa8dd20c6a4","observation_id":"d704db9f-a251-4f17-8f85-a374005d3a83","resolution":{"observed_at":"2026-08-03T09:02:46.974936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.042203Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.042203Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:251fb144f171698db1207d05109f9ce247e5314e17649bbf8b614db373a74ed7","observation_id":"1566f84d-3315-4d20-8885-eeb5934fc992","resolution":{"observed_at":"2026-08-03T09:02:47.042203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.148988Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.148988Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:7f43cb47f4e366cef6be71addf8e345e530127256da123bb76a125c144aa3bd8","observation_id":"73b62937-430b-4fe3-b424-ada6d90446af","resolution":{"observed_at":"2026-08-03T09:02:47.148988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.258000Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.258000Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:e88dd1f3509944566124344a90bbff83e9b66a9b3eb259d4c8ba899c746888db","observation_id":"88a2f2f9-8e3d-4731-be73-aead77c4aa8c","resolution":{"observed_at":"2026-08-03T09:02:47.258000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14489","last_updated":"2025-04-01T18:22:54Z","snapshot_observed_at":"2026-08-07T16:54:11.419701Z","submitted_at":"2025-03-18T17:57:22Z","title":"Stable Virtual Camera: Generative View Synthesis with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14489","snapshot_observed_at":"2026-08-03T09:02:47.336179Z","title":"Stable virtual camera: Generative view synthe- sis with diffusion models.arXiv preprint arXiv:2503.14489,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.336179Z"},"links":{"cited_paper":"/paper/2503.14489","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:fd3a1687c536a9854f35020974af41b282134ac27747d84b5dd3ac9ef3251a57","observation_id":"7927d28a-9024-4db4-a705-dce8a36ecb07","resolution":{"observed_at":"2026-08-03T09:02:47.336179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.413267Z","title":"Cat3d: create anything in 3d with multi-view diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.413267Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:cef2dd320c46fa4109448e2a30e814dd5ffe3dcaa60cf805c5fd6d7d84cf1a2c","observation_id":"02cfe35a-435f-495c-937a-85e8f73fc9f5","resolution":{"observed_at":"2026-08-03T09:02:47.413267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T09:02:47.495902Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.495902Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:3291f556b96346d7d33f5d4d480b95e05bf6a594248a1dbeb29f4087f9d941de","observation_id":"526ef374-57b2-4901-89bf-8170c488362e","resolution":{"observed_at":"2026-08-03T09:02:47.495902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.573116Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.573116Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:9960d70cb6fe93f874d80ca0829d990f2fb97bfab4e8e804f7b820174798ef60","observation_id":"b0273d62-2974-495a-82da-e0fa8bf99bb7","resolution":{"observed_at":"2026-08-03T09:02:47.573116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.715735Z","title":"3d concept learn- ing and reasoning from multi-view images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.715735Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:d7923b2ef7a35014d8e07cfb34be9e0f62373ba55fb06821cc58dae50ce0d52f","observation_id":"33263900-55fd-43dc-822f-bac23004cb59","resolution":{"observed_at":"2026-08-03T09:02:47.715735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.807044Z","title":"Lrm: Large reconstruction model for single image to 3d","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.807044Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:79a69c73640cc77c4544d5bc707d8233ed8ef442d2d9dd5b6df21339a8432804","observation_id":"d69f0bd9-e5bd-4362-9d7d-331f07bbc72b","resolution":{"observed_at":"2026-08-03T09:02:47.807044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.867776Z","title":"Odin: a single model for 2d and 3d segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.867776Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:ee0b777dad3d3bf8e6cbacc79f5582524664f45a8766dba3a932ba936b1d616c","observation_id":"2683c12b-4f43-47ad-b98b-8256078444dc","resolution":{"observed_at":"2026-08-03T09:02:47.867776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:47.946789Z","title":"Lvsm: A large view synthesis model with minimal 3d inductive bias","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:47.946789Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:6ca8361319230e4e8c5e04d5dd23341ceade386970d6f616620b5462d6331b9a","observation_id":"de6473c4-e766-472f-bda4-aa3b55cebbfd","resolution":{"observed_at":"2026-08-03T09:02:47.946789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.018188Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.018188Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:8fbff102ab6c712503b7d8782eb98fd3406ac82f97a6c3254c894035425932dd","observation_id":"14f2893b-ab7d-47e0-9dd6-3157118045ae","resolution":{"observed_at":"2026-08-03T09:02:48.018188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T09:02:48.094382Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.094382Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:36c2c2a329367ea0254200ba121c0032297ef510c5beea960625285e8cab387c","observation_id":"70777f5b-784f-4964-ae2a-35647838ed60","resolution":{"observed_at":"2026-08-03T09:02:48.094382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.198169Z","title":"Eschernet: A generative model for scalable view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.198169Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:5bcb487be338c8f26855165e32c9f48771c39db05a1af91d169d8956a3ab42bd","observation_id":"992865d1-c26c-4e1f-ae07-6d469dca22b3","resolution":{"observed_at":"2026-08-03T09:02:48.198169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.263921Z","title":"Cameras as relative positional encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.263921Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:17609ad5d1771661be6aad2481473bc510590b1d032b695062d38e652c6b194c","observation_id":"3987ab0b-e73e-4616-9dfe-97cb0c8e2c58","resolution":{"observed_at":"2026-08-03T09:02:48.263921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.353327Z","title":"Learnable fourier features for multi-dimensional spatial po- sitional encoding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.353327Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:0de04097a540382bab04077dd6b184de12f126215788a7e1265cbafe31308afa","observation_id":"6c1c41a9-d330-4a07-bb9f-5f3269573203","resolution":{"observed_at":"2026-08-03T09:02:48.353327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.421150Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.421150Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:f99b2c5bdece641552445dabe83594d473873f63eb2f08df24a1d0337c7aab3b","observation_id":"312d47b2-3f13-44e6-bc9c-50f3b54581ca","resolution":{"observed_at":"2026-08-03T09:02:48.421150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.466344Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.466344Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:283a31839ae0d39a825c92bfe365b824693c2d48cf0547718ddaa1b97325a222","observation_id":"1ecbbe76-e3b9-4f93-80f2-957a95207360","resolution":{"observed_at":"2026-08-03T09:02:48.466344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.533366Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.533366Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:736ca8efe27ed81da8e14a2321c31dc050cbbd025c96c9be605b747f71db2f76","observation_id":"394fa997-5a7b-441b-baf9-1bfb35651bcf","resolution":{"observed_at":"2026-08-03T09:02:48.533366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04236","last_updated":"2026-05-03T04:02:22Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T15:03:31Z","title":"Scaling Sequence-to-Sequence Generative Neural Rendering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04236","snapshot_observed_at":"2026-08-03T09:02:48.574653Z","title":"Scaling sequence-to- sequence generative neural rendering.arXiv preprint arXiv:2510.04236, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.574653Z"},"links":{"cited_paper":"/paper/2510.04236","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:7af3acc20938abb673dc639dc4762c3214112e027cee464be7206bc1f95a0488","observation_id":"f1e39b2e-9f23-49a3-bf8c-f31027718c41","resolution":{"observed_at":"2026-08-03T09:02:48.574653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.642522Z","title":"Gta: A geometry-aware attention mechanism for multi-view transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.642522Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:ea030f7cc49d134c30e1e260185d2820d807b2ccc37dfd7d9cab0df0d9848ca7","observation_id":"a29d31ef-02f8-4866-a956-b715829f5749","resolution":{"observed_at":"2026-08-03T09:02:48.642522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.686212Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.686212Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:b0f34ce17f187b456aa3c5cc72eed38da0e871ab4eeb0323ab3454e3c04d1e94","observation_id":"dec8e417-02ce-4b4b-bbc8-8929abe6adfb","resolution":{"observed_at":"2026-08-03T09:02:48.686212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.756145Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.756145Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:0b0691b4fcd7db84d5f9a2d72518616c962a94de47d2474ae18643608506535b","observation_id":"4710a5f4-c385-436c-a94d-a38aa32f85cb","resolution":{"observed_at":"2026-08-03T09:02:48.756145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.798579Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.798579Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:fb2e187276da090fe0a6a71ece581af0e545a03b3710f81e7ed404222751be95","observation_id":"49d48128-e54a-4fc9-9548-4f6382e25a3e","resolution":{"observed_at":"2026-08-03T09:02:48.798579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.867932Z","title":"Sam 2: Seg- ment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.867932Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:5902443962223e3da84cd7a1f9b4f5de813e575fd5f9d36ec92177ff8ae4ffbb","observation_id":"1a0c444f-39a3-4028-ab09-b670cc5c16cd","resolution":{"observed_at":"2026-08-03T09:02:48.867932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.913721Z","title":"Com- mon objects in 3d: Large-scale learning and evaluation of real-life 3d category reconstruction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.913721Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:cfe78d19b90b81496a2a64ad0716fe3f3ec6a5938e5e9c2e797361389f314ce5","observation_id":"a2b60c47-5577-47e5-b29b-71e9f54b84bb","resolution":{"observed_at":"2026-08-03T09:02:48.913721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:48.983077Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:48.983077Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:8bb7c91559eff42335fc6a18ea5374c7be28399b0f8d20e21ddcd2ab6427b64f","observation_id":"d71ef1c1-fec8-46b3-9673-c090d1f5cd77","resolution":{"observed_at":"2026-08-03T09:02:48.983077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.039205Z","title":"Learning the ropes: Better 2d and 3d position encodings with string","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.039205Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:48bb35ccd917da78a11e4ed2f71cde8dea12c0406f7e35f3568274fe208d4a76","observation_id":"482e906a-523c-4929-9df2-b5f422432fcf","resolution":{"observed_at":"2026-08-03T09:02:49.039205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.077456Z","title":"Self- attention with relative position representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.077456Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:b00b2d9b0c9c403bee3d2e33bb6c9848dc5d1709612de7365f5dba3252625e1d","observation_id":"3496c383-93e8-46b4-844c-becfb9e860e5","resolution":{"observed_at":"2026-08-03T09:02:49.077456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-03T09:02:49.202458Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.202458Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:f1abd44320688d59e5e77f98e4bd74a878730cad0f2f5c4eabdc979d44a30964","observation_id":"d7febf5e-ce5a-46b8-bda4-57f503a47a35","resolution":{"observed_at":"2026-08-03T09:02:49.202458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.361491Z","title":"A benchmark for the eval- uation of rgb-d slam systems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.361491Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:f0295f47cf9cb224c5b6b1773d28e54ddf7f693ffc0ab785d494c2ff144c6ee3","observation_id":"f275ce28-89c2-49cf-919b-22babc5bd996","resolution":{"observed_at":"2026-08-03T09:02:49.361491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.535159Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.535159Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:fdb2923d2a987313383b31552dab167f0ef10c1671c79d25776500b165cd2469","observation_id":"4db9e846-593a-4a6e-9fac-146bf548f0f1","resolution":{"observed_at":"2026-08-03T09:02:49.535159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.671549Z","title":"Bolt3d: Generating 3d scenes in seconds","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.671549Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:bba22bf9bf6f0d49a638d6ac3e959439bf7b0e387f6a6d499888692ef7c7b132","observation_id":"0b82d22f-153a-48c8-bea3-850666efa440","resolution":{"observed_at":"2026-08-03T09:02:49.671549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.766884Z","title":"Lgm: Large multi-view gaus- sian model for high-resolution 3d content creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.766884Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:385ee2f81c986c71df9452f7b6fc9e7f1186c18a15164be14cc51f44d5cf1909","observation_id":"506dd14e-755c-4163-8697-7471c56d9a94","resolution":{"observed_at":"2026-08-03T09:02:49.766884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T09:02:49.830770Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.830770Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:d0237f42bf0be58deef2698f51dd3625a0d2b8545ac23f647381928caf756d29","observation_id":"5f4eb199-86a2-43b6-bd67-2f8bff647967","resolution":{"observed_at":"2026-08-03T09:02:49.830770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.943797Z","title":"Ummenhofer, H","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.943797Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:534e366695c432ed1530d4572d5ef0b6dc49b3d5585444b6847066e228ba8656","observation_id":"511a9a8d-5c32-4c9e-9d90-2d08da5d84de","resolution":{"observed_at":"2026-08-03T09:02:49.943797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:49.995515Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:49.995515Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:d05a2b0978566cc7bfd5262c4b61a71cf302adcd7139dd72040eabff6d575ee1","observation_id":"7d2a3f71-7d43-4feb-b6ca-c347a5af888d","resolution":{"observed_at":"2026-08-03T09:02:49.995515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.045626Z","title":"Bullettime: Decoupled control of time and camera pose for video generation.arXiv preprint arXiv:2512.05076, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.045626Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:b2a3891ddab13a2df30ade75d7235ca93fc20d291a5a0cd73dd79877470002ec","observation_id":"5b3a6abb-2827-4532-b7d0-de30f3d1250c","resolution":{"observed_at":"2026-08-03T09:02:50.045626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.109414Z","title":"Sun3d: A database of big spaces reconstructed using sfm and object labels","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.109414Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:8103a364e5f9779a3fab0a41210d84d844aacd6d5a3739a8d21d8f499dac8bc0","observation_id":"3000bbdf-f6b7-4e7d-92e3-7a6d08e07f5b","resolution":{"observed_at":"2026-08-03T09:02:50.109414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.150261Z","title":"Unifying flow, stereo and depth estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.150261Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:cdbdb8235b4e354c0339aea849b95039f5b8e6c503e7652d27304477bdfa857c","observation_id":"53767309-47d5-48e2-a269-4b52e7dcdc91","resolution":{"observed_at":"2026-08-03T09:02:50.150261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.222108Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.222108Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:bc749857a426ab2c77c0117194232baac71ed6f9cb99d001c876fea79ae1e2c8","observation_id":"6882caf0-e258-4e73-8b1d-2b78acb062e2","resolution":{"observed_at":"2026-08-03T09:02:50.222108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.273214Z","title":"Unified camera positional encoding for controlled video gen- eration.arXiv preprint arXiv:2512.07237, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.273214Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:6007797ca6d9fcbb8d8ced7c4028fac7ab0e58c61491828f92fcf0b2b6ae9068","observation_id":"43252814-f8b0-4583-a729-8827d84e64a8","resolution":{"observed_at":"2026-08-03T09:02:50.273214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.365186Z","title":"Cameras as rays: Pose estimation via ray diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.365186Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:e31a4d955bd1b5c5ef7c208a4c97e6dcd14e0be3ade6924fe481211d3ab3511e","observation_id":"73da3fa0-1688-4d67-a0b8-c8ab2120040f","resolution":{"observed_at":"2026-08-03T09:02:50.365186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.433950Z","title":"Gs-lrm: Large recon- struction model for 3d gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.433950Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:9789ab23084c745a803085e8cf157b600157f1c655da76709575b47325d7b56d","observation_id":"c9a6d7aa-da5b-4599-8f81-147a3170be06","resolution":{"observed_at":"2026-08-03T09:02:50.433950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.502760Z","title":"Stereo magnification: Learning view syn- thesis using multiplane images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.502760Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:2570fa09549ec92646c84df10dc2e9272cb42eb6818471d6b1f179a682a5f061","observation_id":"c42d3eae-db78-4afb-90f3-ea17bc05e7bd","resolution":{"observed_at":"2026-08-03T09:02:50.502760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.587541Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.587541Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:fe17b71500fe7fc01c9b540ec74bd31fddbce34ae56f34f29888830f7d9e5303","observation_id":"96e5fc36-c429-4027-803f-37f4e8db9181","resolution":{"observed_at":"2026-08-03T09:02:50.587541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:02:50.657028Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T09:02:50.657028Z"},"links":{"citing_paper":"/paper/2601.15275"},"observation_digest":"sha256:d25dba36f1e3536657559b35388e3f72c468472532f60ead0f738a229b3f1988","observation_id":"b23d47bb-5b0b-45d4-9b8a-90ac1eef5acb","resolution":{"observed_at":"2026-08-03T09:02:50.657028Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.15275","last_updated":"2026-07-06T18:52:05Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T09:02:45.848359Z","submitted_at":"2026-01-21T18:55:51Z","title":"RayRoPE: Projective Ray Positional Encoding for Multi-view Attention"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 8 inbound Pith citation observations for arXiv:2601.15275."}