{"as_of":"2026-08-08T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7f52ad8bfde65566405beda4e458447cd994575acebd6e5b59339d9098acd46","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:59.503626Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T20:34:35.048469Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:08:59.885995Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":"2506.05856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view multi-modal segmentation@ ego- exo4d challenges 2025.arXiv preprint arXiv:2506.05856","venue":null,"work_id":"a73a0308-39f0-486e-bc57-ab68373315e7","year":2025},"citing_paper":{"arxiv_id":"2511.20886","last_updated":"2026-04-08T06:35:31Z","snapshot_observed_at":"2026-07-06T22:36:59.311174Z","submitted_at":"2025-11-25T22:06:30Z","title":"V$^{2}$-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T04:08:32.413555Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2511.20886"},"observation_digest":"sha256:9e80eb2e6e7e40c8838ae97fa7ac8224a3c33746c4676675224e47e50f8b0e46","observation_id":"45f5f125-8168-42f0-a724-759311ab1d31","resolution":{"observed_at":"2026-05-17T04:08:59.888437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":"2506.05856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view multi-modal segmentation@ ego- exo4d challenges 2025.arXiv preprint arXiv:2506.05856","venue":null,"work_id":"a73a0308-39f0-486e-bc57-ab68373315e7","year":2025},"citing_paper":{"arxiv_id":"2602.14122","last_updated":"2026-04-18T15:08:17Z","snapshot_observed_at":"2026-08-02T05:18:20.195131Z","submitted_at":"2026-02-15T12:46:35Z","title":"EgoSound: Benchmarking Sound Understanding in Egocentric Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T21:44:47.636912Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2602.14122"},"observation_digest":"sha256:5dbeb2f6194f0bb8a4b1e49bba180875ca56343f33576f9929a970969125eba9","observation_id":"378ac56e-6c33-4603-adf4-bd3f9b767014","resolution":{"observed_at":"2026-05-15T21:46:42.453337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":"2506.05856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view multi-modal segmentation@ ego- exo4d challenges 2025.arXiv preprint arXiv:2506.05856","venue":null,"work_id":"a73a0308-39f0-486e-bc57-ab68373315e7","year":2025},"citing_paper":{"arxiv_id":"2604.13793","last_updated":"2026-07-01T12:10:20Z","snapshot_observed_at":"2026-07-12T20:34:29.325299Z","submitted_at":"2026-04-15T12:32:25Z","title":"From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:35.738229Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2604.13793"},"observation_digest":"sha256:64a385acf8f57336b916bc39dfae1488b956de8bc972ef0f22dcd45356f3ed0f","observation_id":"e1f06317-7c39-4021-8e94-02a06f54a6ca","resolution":{"observed_at":"2026-05-10T13:25:26.135752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-07-12T20:34:35.048469Z","title":"arXiv preprint arXiv:2506.05856 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13793","last_updated":"2026-07-01T12:10:20Z","snapshot_observed_at":"2026-07-12T20:34:29.325299Z","submitted_at":"2026-04-15T12:32:25Z","title":"From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T20:34:35.048469Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2604.13793"},"observation_digest":"sha256:c56086eccaab0afd5e4b41bdeca69285deaa03a584a7d7d8bca5e8563bcc4257","observation_id":"bead3897-5736-46bc-bd36-2ff7e272972b","resolution":{"observed_at":"2026-07-12T20:34:35.048469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05856/citation-record","integrity":"/paper/2506.05856/integrity","json":"/paper/2506.05856/citation-record.json","paper":"/paper/2506.05856"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.08020","last_updated":"2023-09-14T20:31:06Z","snapshot_observed_at":"2026-07-06T16:18:41.478772Z","submitted_at":"2023-09-14T20:31:06Z","title":"Temporal-aware Hierarchical Mask Classification for Video Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08020","snapshot_observed_at":"2026-08-07T10:18:56.249004Z","title":"Temporal-aware hierarchical mask classi- fication for video semantic segmentation.arXiv preprint arXiv:2309.08020, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.249004Z"},"links":{"cited_paper":"/paper/2309.08020","citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:38b2435edf0a9ed5986740c8608d6c81ed9533b0eba780ae48b97aba12e6320d","observation_id":"2f443e88-6f5d-4d08-ad89-862e47251202","resolution":{"observed_at":"2026-08-07T10:18:56.249004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:04.304500Z","title":"Cafuser: Condition-aware multimodal fusion for robust semantic perception of driving scenes.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":"497a754c-fd33-41ee-b9d7-07108396db51","year":2025},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.403870Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:8b3974fe31e18a5af3798d65ff213fc82916fda127fff0bc3fa7b20eee29d463","observation_id":"725b2662-33f0-4a09-a40b-44a60a7ca21b","resolution":{"observed_at":"2026-08-07T10:19:04.443359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.608701Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.608701Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:830c2dee1cefea5e33386f9895540342990a3130a7233c8c903fe3e4e3ea5116","observation_id":"005689ea-7fa6-4dd9-a440-cf2077ddbf35","resolution":{"observed_at":"2026-08-07T10:18:56.608701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19083","last_updated":"2025-07-25T17:11:59Z","snapshot_observed_at":"2026-08-07T06:18:30.658127Z","submitted_at":"2024-11-28T12:01:03Z","title":"ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19083","snapshot_observed_at":"2026-08-07T10:18:56.887838Z","title":"Objectrelator: Enabling cross-view object relation understanding in ego-centric and exo-centric videos.arXiv preprint arXiv:2411.19083, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.887838Z"},"links":{"cited_paper":"/paper/2411.19083","citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:72588bd129b7fc9668b53d63150e42e3781ed4001e5f0e02bbc77a71fff34af3","observation_id":"9a9bd9f0-db89-474f-9dbb-3059afafdf53","resolution":{"observed_at":"2026-08-07T10:18:56.887838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.930016Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":"00d10b4a-135c-4fee-938e-842e03078e23","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.082792Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:9ac7fc63680e5e9521074dc566ecb3a8781e189fb2ac1d672d39a7fced42a1c6","observation_id":"e9ede233-0518-4a9b-adb7-71326dc6b4df","resolution":{"observed_at":"2026-08-07T10:19:04.082575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.577164Z","title":"X-prompt: Multi-modal visual prompt for video object segmentation","venue":null,"work_id":"f36a44a1-2b03-483c-9f76-9e62369093cb","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.211327Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:8dec953c45134d34d4c310db02f471a0f43582b5b6330ec9ae3f8b3626eec862","observation_id":"dcc6bcdd-1821-4e1d-bdbc-b6f208832efe","resolution":{"observed_at":"2026-08-07T10:19:03.750415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.352999Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.352999Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:f8a3777740e6d2be96d197dfada400d984a385cce4b738daa0a5efc5d478a7e2","observation_id":"2248e8af-93c6-461e-8043-9a5845b92469","resolution":{"observed_at":"2026-08-07T10:18:57.352999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.217808Z","title":"Segment any- thing","venue":null,"work_id":"70b33c79-60d0-4d7d-ab85-8d4b7674fa0d","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.574611Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:17a3a1a0dedb389d9c3ddc279c3ec6017dd1551c24c09604da1fc4cae261753f","observation_id":"8c715af6-5be4-49c1-9adf-03527e671253","resolution":{"observed_at":"2026-08-07T10:19:03.388111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.715692Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.715692Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:33a0f01fc42737ae7e29643b2c4a4a454c131aac8ac62d5a16d27d4c5ab76118","observation_id":"1eec0d54-d72c-48c0-9cef-dd27f930a10e","resolution":{"observed_at":"2026-08-07T10:18:57.715692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.930645Z","title":"Onevos: unifying video object segmentation with all-in-one transformer framework","venue":null,"work_id":"ee60dbc7-adf8-43cf-9485-3298d815828a","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.915378Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:75005265eb85a263770d4f0256a583b56acf66fc3b6f4c641a0ac4a2647e818d","observation_id":"dffa37fb-3d66-4632-aa6e-62a3288a89c9","resolution":{"observed_at":"2026-08-07T10:19:03.076345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.470444Z","title":"Omg-seg: Is one model good enough for all segmentation? InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 27948–27959, 2024","venue":null,"work_id":"300c7bea-6cbf-4967-aed6-f7cf44546cb3","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.062171Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:d4069f3487fb560951ec650c60815f62ae17ecb92de5b10491da589d4969c10d","observation_id":"bb2f6463-df76-41e6-a09a-21e7517ed54e","resolution":{"observed_at":"2026-08-07T10:19:02.653871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.076362Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"b19c7f0a-4d67-4f42-a274-ec20e76a347a","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.185928Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:6da1a98fa2d6662b5a7c067433bf54eb089c76a7053e42099933cafbc6c87dd1","observation_id":"b17b2a62-90ab-4414-8a7e-aeedd7231407","resolution":{"observed_at":"2026-08-07T10:19:02.276457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.801427Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"d69e1d87-af76-43ac-a777-060b2cf049f8","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.377127Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:40d913bf60ce9529aee7dc57c7cb1aa83124a4d8a9dc2998ae5e06a82232a76b","observation_id":"8f8f8368-3aaf-454a-9730-17e3c90ee25b","resolution":{"observed_at":"2026-08-07T10:19:01.929591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.523241Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.523241Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:97429523bd5e3aa1fd56f7ce9764625b102ea78f360077fd7a2eece050df7d3c","observation_id":"c39d921c-cc6a-44fd-9681-6a09baecdfa2","resolution":{"observed_at":"2026-08-07T10:18:58.523241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.380082Z","title":"Object segmentation by mining cross-modal se- mantics","venue":null,"work_id":"c84022eb-dd6e-40b7-8153-20e3db33d95f","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.644474Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:758908a0edaf4096e5bf3e0a3ad2ec24684333c8fd4c419a62d4dacd402713be","observation_id":"dd7159c9-5b50-43aa-8975-22f8c1e711db","resolution":{"observed_at":"2026-08-07T10:19:01.625200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.018556Z","title":"Universal instance percep- tion as object discovery and retrieval","venue":null,"work_id":"ad9ced3f-0c36-47b8-8986-2727c5008755","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.788169Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:467c3781b7f5e2e43cf6fbe21f695310718e0a30297b5711a0556ff97054f0a8","observation_id":"c747ee1b-86f7-4769-86c8-34b97e4cbe48","resolution":{"observed_at":"2026-08-07T10:19:01.197110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.759431Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"93ce8fea-5967-473d-8c7a-a0bd29a2639a","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.981985Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:f49ad0cbc11902668258abce349894c972c9a56382e04b2c5bb0a6efc0773883","observation_id":"759a649d-20e8-4891-9aef-ac73f5c4a62c","resolution":{"observed_at":"2026-08-07T10:19:00.878470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.495729Z","title":"Learning modality-agnostic representation for semantic segmentation from any modalities","venue":null,"work_id":"51710b0e-af90-4ceb-9d5c-0c0e83299671","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.093530Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:c959f12726e7af2472b8ef4fdfded90ff32317d562b323f2bc92ce46bbb31f60","observation_id":"19814800-e546-41d5-9444-5c9be91d9830","resolution":{"observed_at":"2026-08-07T10:19:00.648495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.178104Z","title":"Distilling efficient vision transformers from cnns for seman- tic segmentation.Pattern Recognition, 158:111029, 2025","venue":null,"work_id":"1b039095-f4d6-49bd-8d0e-3bae0be60634","year":2025},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.200838Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:db33a8a3e1bbf9fd43c55d16aa899d56559c740cdd2ea30dcc64e067c69a4aa0","observation_id":"4410f5b4-1a5e-42e0-a987-d38127f4db51","resolution":{"observed_at":"2026-08-07T10:19:00.321486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:59.275393Z","title":"Camsam2: Segment any- thing accurately in camouflaged videos.arXiv preprint arXiv:2503.19730, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.275393Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:c71eeb49f84cb859bf712afd120bd43e248235f6fe5f6257c21f07e636d7cbc2","observation_id":"78db28db-7858-4696-b071-c70b71236434","resolution":{"observed_at":"2026-08-07T10:18:59.275393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:59.840876Z","title":"Segment everything everywhere all at once.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"fa70277b-d9a9-44c7-be7b-fa4325ed443e","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.503626Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:23444408029e8623c25701614bf6ad916a519ee4c6c1644428768533eff5c300","observation_id":"c941f7fe-cc7c-4db7-95a0-8ab2d87d253f","resolution":{"observed_at":"2026-08-07T10:19:00.032209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:11:01.230886Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 4 inbound Pith citation observations for arXiv:2506.05856."}