{"as_of":"2026-08-10T05:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:966fc46c5f27af24125fd504e70c5806edb5a425d0224a2a4734b09c7e50b85b","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:08:47.365596Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:10:17.325958Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:47:30.631926Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2506.04277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-07-03T00:47:30.631926Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought","venue":null,"work_id":"026d3dfa-6287-4f2b-833c-eeb4fd2944df","year":2025},"citing_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-17T20:22:46.220021Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2511.16719"},"observation_digest":"sha256:174278318a7056713127f1a09892d460cc95c9139a4694ba05d4f8f41baaf687","observation_id":"0ffd6ff2-f54f-4d8a-9d37-5055ffd9f570","resolution":{"observed_at":"2026-05-17T20:25:11.519580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-08-03T14:10:17.325958Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought.arXiv preprint arXiv:2506.04277,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.21414","last_updated":"2026-07-09T01:40:47Z","snapshot_observed_at":"2026-08-08T03:45:18.921452Z","submitted_at":"2025-12-24T20:30:01Z","title":"A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T14:10:17.325958Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2512.21414"},"observation_digest":"sha256:a1e037a41deaf6435af89dba7837155efc410f21875303f46fb9569be0c19f77","observation_id":"49641d1b-4775-40c6-a75b-a7368f48152b","resolution":{"observed_at":"2026-08-03T14:10:17.325958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2506.04277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-07-03T00:47:30.631926Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought","venue":null,"work_id":"026d3dfa-6287-4f2b-833c-eeb4fd2944df","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T20:12:46.385646Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:f47e2c11a3a8b1b23fbe8f4efa2967340ae3a501bfc7dd5e1c9a9741c5e9f55d","observation_id":"f7e37821-8e46-41e3-ba15-3eaf6e4791dc","resolution":{"observed_at":"2026-05-15T20:16:34.528679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2506.04277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-07-03T00:47:30.631926Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought","venue":null,"work_id":"026d3dfa-6287-4f2b-833c-eeb4fd2944df","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T10:30:06.829915Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c3bf82414d556d940ffdcf1efd9c1b2a36d0890ac0c7e6fcacecf127ab9eca18","observation_id":"f33bb049-8095-4067-98f4-d6b7bc5feac5","resolution":{"observed_at":"2026-05-22T10:31:25.098104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-08-02T22:00:07.204123Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought.arXiv preprint arXiv:2506.04277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:07.204123Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c2fe88c9e51fdc3e54033c7b8128413d8f67594f034a1d676d2f75594adee6d6","observation_id":"f5f8ffce-3e0a-4b13-a6cb-a408093d7064","resolution":{"observed_at":"2026-08-02T22:00:07.204123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2506.04277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-07-03T00:47:30.631926Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought","venue":null,"work_id":"026d3dfa-6287-4f2b-833c-eeb4fd2944df","year":2025},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:7ef872a60bb03efc30e894281ae336630d618870b75cfdc98ce63068cf3f845a","observation_id":"97b80294-61cb-429e-b5e1-b3d601a20faa","resolution":{"observed_at":"2026-05-20T05:53:04.431402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2506.04277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04277","snapshot_observed_at":"2026-07-03T00:47:30.631926Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought","venue":null,"work_id":"026d3dfa-6287-4f2b-833c-eeb4fd2944df","year":2025},"citing_paper":{"arxiv_id":"2606.09303","last_updated":"2026-06-08T10:10:55Z","snapshot_observed_at":"2026-07-06T23:48:39.574979Z","submitted_at":"2026-06-08T10:10:55Z","title":"Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:13.745646Z"},"links":{"cited_paper":"/paper/2506.04277","citing_paper":"/paper/2606.09303"},"observation_digest":"sha256:527cf4af6c37459c95159559e18be24cc5681ab7a851eb9343995efc9cc02342","observation_id":"5e176c91-e057-457a-99bc-1fa61be974c2","resolution":{"observed_at":"2026-07-03T00:47:30.633469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04277/citation-record","integrity":"/paper/2506.04277/integrity","json":"/paper/2506.04277/citation-record.json","paper":"/paper/2506.04277"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T11:08:40.402070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:40.402070Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:ade2f03b9d992a61944911e10b8ec7b56b667a9b499f7b9ec21f5d1b761c36ff","observation_id":"e5f23e84-ba59-44de-bd41-5be8ded3fc81","resolution":{"observed_at":"2026-08-07T11:08:40.402070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06070","last_updated":"2024-03-10T03:29:56Z","snapshot_observed_at":"2026-08-09T00:24:15.204067Z","submitted_at":"2024-03-10T03:29:56Z","title":"Reframe Anything: LLM Agent for Open World Video Reframing","version":1},"cited_work":{"arxiv_id":"2403.06070","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06070","snapshot_observed_at":"2026-08-07T11:08:48.129759Z","title":"Reframe Anything: LLM Agent for Open World Video Reframing","venue":"cs.CV","work_id":"f0480b79-11a6-496f-b93d-2b225c8cb361","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:40.474413Z"},"links":{"cited_paper":"/paper/2403.06070","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:b2524d8adcd74f0a7fe90a967f447219b27dc158c139493eb1b9d51d4cd52f07","observation_id":"ba55ffd2-d882-44ca-85b4-7107ee658769","resolution":{"observed_at":"2026-08-07T11:08:48.258624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T11:08:40.556277Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:40.556277Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:53e2f876016c8fe3752c557302916625ce960d9b7e25fc7279fb6bd61b2608f8","observation_id":"af604303-f121-4e89-bf79-d0a64c592fa4","resolution":{"observed_at":"2026-08-07T11:08:40.556277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:54.612180Z","title":null,"venue":null,"work_id":"9f301543-eb24-4e26-a586-f1910ad9ee24","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:40.681671Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:f975c0b8812e10e8a47733bbf25bceb172ca445ef0c3b38e3cc06a8fc4412688","observation_id":"c4bbb67e-1a05-4f59-a731-b4446a15aba3","resolution":{"observed_at":"2026-08-07T11:08:54.729787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:54.384342Z","title":null,"venue":null,"work_id":"69d8842a-0e5c-4f68-afd0-f1531e9146b4","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:40.787454Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:ec2b493f6feec7c726ccf825055c6f6efd6b475e5884bdf1c9a13a4c0e7fafaf","observation_id":"e46b9ce0-3507-42ed-9fa0-5445fb7a13ac","resolution":{"observed_at":"2026-08-07T11:08:54.514876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:54.153315Z","title":null,"venue":null,"work_id":"871d7710-6a1d-4fec-b58c-fe243b850b75","year":2021},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:40.984131Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:c4285aa00359125f9ffd25ede97c550d0293ab523eaed5083a6b373108a47e73","observation_id":"2ec218c6-b22e-4362-881e-4b7d6aff0071","resolution":{"observed_at":"2026-08-07T11:08:54.264144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:08:41.110594Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:41.110594Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:b73345aa371cc6ef4a2e17aa958808fe78dabb8f456af4253305ccda3ccd060e","observation_id":"69a6d90d-2fa3-43ed-9d7c-6d693f9152a7","resolution":{"observed_at":"2026-08-07T11:08:41.110594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.933105Z","title":null,"venue":null,"work_id":"b21c5fa3-a9c5-41ae-8b7c-fe60cff6bb13","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:41.266042Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:7ea5804ef1995412e3ddc59845923afabc202525ccb239a70ba4495435417480","observation_id":"f75fec81-34f7-44c8-b523-8cb03ab78cd9","resolution":{"observed_at":"2026-08-07T11:08:54.046756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.673800Z","title":"Berg, Wan-Yen Lo, Piotr Doll \\'a r, and Ross B","venue":null,"work_id":"c183434f-a1c7-45cb-9ac1-ce2453a1b57c","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:41.417931Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:e01bba0a7b46fe9f64b2b1049c3dfe99fc1b8ba170458395834a49d641984d04","observation_id":"332913ec-3213-4238-b852-00678b9d6229","resolution":{"observed_at":"2026-08-07T11:08:53.818075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:41.567535Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:41.567535Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:4e52f05b633744e9ba78df6f88848ab1848dbcabb9491be6f2695b4d0cad2336","observation_id":"6ca3f72d-c73e-40b3-a3bc-0b126bcfcb13","resolution":{"observed_at":"2026-08-07T11:08:41.567535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:41.796732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:41.796732Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:d9702cb8ed7bfa4164f850bcf6fa8f0f7b4cc1adcd0fea164b89c08330806874","observation_id":"b7ba99d1-bc73-4c31-8fa0-5837d3cb84a8","resolution":{"observed_at":"2026-08-07T11:08:41.796732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17828","last_updated":"2025-04-24T04:36:28Z","snapshot_observed_at":"2026-08-07T15:59:40.224743Z","submitted_at":"2025-04-24T04:36:28Z","title":"VEU-Bench: Towards Comprehensive Understanding of Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17828","snapshot_observed_at":"2026-08-07T11:08:41.965687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:41.965687Z"},"links":{"cited_paper":"/paper/2504.17828","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:24d744864b531f85480b1b3f3d7344b54742d6c1185c166d8b18d854e6558b6c","observation_id":"86bf2cb7-94da-403f-8ed4-05db4472013b","resolution":{"observed_at":"2026-08-07T11:08:41.965687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-09T18:37:19.036481Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-07T11:08:42.177990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:42.177990Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:567d42b28256ddc7ad32ce982bcf15aa7141115b27a450a04ba8edfd387621e3","observation_id":"8aa6eeb3-2245-4d99-8f1c-4cef689c819a","resolution":{"observed_at":"2026-08-07T11:08:42.177990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.376093Z","title":null,"venue":null,"work_id":"699c2f81-6345-4c4f-a354-f0db3f45978f","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:42.377897Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:8820afa8a978b3287efc871918ac783bbba0d19c7e4d7cbd3849150877e4ff36","observation_id":"e32e10fc-095e-4f50-a471-72f556a82b9a","resolution":{"observed_at":"2026-08-07T11:08:53.515400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T11:08:42.538130Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:42.538130Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:0a4af5751cf870ac7a05ae82c3234a297ae89f379958031ca4274e36a8ef5ce0","observation_id":"a1aa0c70-a29b-4b96-b5e4-a09febec9bff","resolution":{"observed_at":"2026-08-07T11:08:42.538130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T11:08:42.665200Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:42.665200Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:244cd66caac05c789536ac33eec19e44bb92cfe9c5eaf3a411d5450b6515ce92","observation_id":"0b696a43-dd1a-4874-b45b-28cd24fca905","resolution":{"observed_at":"2026-08-07T11:08:42.665200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:42.819240Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:42.819240Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:2579a9494b23dffabf4e6c2f662d244974726daea7f08448826cb93f23166563","observation_id":"02ce7b08-8488-445d-88ce-899b1600cbcb","resolution":{"observed_at":"2026-08-07T11:08:42.819240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.123446Z","title":null,"venue":null,"work_id":"6be49ea8-5d65-42a0-b22d-56c96b909b48","year":2020},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:43.047540Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:957eef573f4d6f4b861b7a0fcafd9308c1d1ac770841eeb8718f1d57c957be29","observation_id":"d78528e8-4679-4c96-9299-0e685a999408","resolution":{"observed_at":"2026-08-07T11:08:53.235178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:52.879392Z","title":null,"venue":null,"work_id":"820434b4-cd18-411c-89a8-0b758d427a5c","year":2015},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:43.249635Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:35ba08fc46d672208236f8282c8407e7770b12b5bbba5e247b3273821bcf69fe","observation_id":"38c7cbb9-2171-4374-95fe-3453f32c5ea8","resolution":{"observed_at":"2026-08-07T11:08:53.008973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:08:43.409280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:43.409280Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:fde708a5aeed8033aa16dc24ef70260e6934a1f98ff0eab84d88071f933781a2","observation_id":"1086a62e-8c4b-4569-b9c5-8c0f98f29315","resolution":{"observed_at":"2026-08-07T11:08:43.409280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T11:08:43.637508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:43.637508Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:95ae3e5914c202dbb2556f587ac8c91f5ed2d7280941f84b82aa8169902f1fcc","observation_id":"07bd95a2-0b61-41ef-8f6f-ef55e92d43b4","resolution":{"observed_at":"2026-08-07T11:08:43.637508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:52.615120Z","title":null,"venue":null,"work_id":"2a6e2a06-9353-45db-a4a4-f1a9a57c6dc6","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:43.844069Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:4f1c78da385478eac8a94a2fa1eb5941fab36cd7496a4673337ee14925a67045","observation_id":"59c95392-210b-4abb-a5dc-0851f2c3d032","resolution":{"observed_at":"2026-08-07T11:08:52.759769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05814","last_updated":"2025-03-24T23:07:01Z","snapshot_observed_at":"2026-07-06T18:27:45.631190Z","submitted_at":"2024-06-09T15:00:28Z","title":"TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05814","snapshot_observed_at":"2026-08-07T11:08:44.046424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.046424Z"},"links":{"cited_paper":"/paper/2406.05814","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:d073df9944c837c4c96bd847011065f52d5941074ad1b8ba55cb318cf841e3ee","observation_id":"c8cc211c-6e79-45ad-921a-179e08be9277","resolution":{"observed_at":"2026-08-07T11:08:44.046424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:52.377738Z","title":null,"venue":null,"work_id":"ac310e4e-1f14-4e1e-b1d3-0bb36741dadd","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.100873Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:e5c09360b1593a974281536aaa14036d26bf963cec8ec4e36850353b668c0d55","observation_id":"d361bb9e-de9f-4f66-8159-23c9defc968d","resolution":{"observed_at":"2026-08-07T11:08:52.450294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:44.190797Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.190797Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:bfc5d45b36c276d472aa57f6906ba3363d71a515999ff4b30d0becc0e6037ccd","observation_id":"666dbb4a-c7d0-4f11-875b-1b49aa22f766","resolution":{"observed_at":"2026-08-07T11:08:44.190797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:52.128716Z","title":null,"venue":null,"work_id":"45f99fe3-9f89-4452-84cc-dbd38acc4108","year":2020},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.257827Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:81ac81328b89ff5dba9387f46e00a3b4c9521f365066cc0b0a5d25f51139d7f7","observation_id":"bc1cc798-6871-4981-ba66-7bedd1d77ff8","resolution":{"observed_at":"2026-08-07T11:08:52.265401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T11:08:44.329476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.329476Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:9fade6d5f9e4e7f8276f80f4d92556cb79d28a626dd7a8158e6548a66c1fa8e6","observation_id":"28d2689c-4b13-477e-b09d-a028170a9f29","resolution":{"observed_at":"2026-08-07T11:08:44.329476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:51.919118Z","title":null,"venue":null,"work_id":"85f14c61-abe8-4f67-9b96-5a971a2ccda7","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.414812Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:6d2131038c6ccb82578b97bda4e4a52fd97f5b30e1f7ad05d2d5c98494feadec","observation_id":"f553a1ed-58f5-4e64-ade8-c85ee0a09b8d","resolution":{"observed_at":"2026-08-07T11:08:52.024786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:44.516389Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.516389Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:95fbd65659ac08405efa8a4eff9d86ece73db2a5de28b71ccb16cdbfb0a26af0","observation_id":"37da8636-f985-4409-96fb-2f399c848057","resolution":{"observed_at":"2026-08-07T11:08:44.516389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:08:44.644702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.644702Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:bde50734eb953f74d7504a5a7ea6b06ef0de37eeff58e1048ad73de0f9992593","observation_id":"52cb0a5b-b851-4a36-955c-2efaf3e4ed51","resolution":{"observed_at":"2026-08-07T11:08:44.644702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:51.687053Z","title":null,"venue":null,"work_id":"602b06d6-bc8a-4f1b-a6b8-e1b249ce222b","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.764286Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:0615a3da01441e4f56a9b9695611611603e85887b3b89367d78e72be1849c5a7","observation_id":"1892add0-d767-490e-97af-c7f2addd3e02","resolution":{"observed_at":"2026-08-07T11:08:51.782181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-09T06:43:33.951821Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-07T11:08:44.852833Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.852833Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:8f3049014b0eff3e6e4e615a7e18a246baea18e1e26541ea37f6db8a79131292","observation_id":"e36f32f9-6776-45a0-ae8e-a42c8fc583af","resolution":{"observed_at":"2026-08-07T11:08:44.852833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:51.417001Z","title":null,"venue":null,"work_id":"7216a5a2-407a-4e0c-a2d2-2d9c89e3a62f","year":2021},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:44.994367Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:62e1f338712a13c377049e7ac7823c10ec76f3db9f1a4c7351bbb3c0027fdabc","observation_id":"65624622-d2fc-4af3-a3c5-ff048ec6b058","resolution":{"observed_at":"2026-08-07T11:08:51.565953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08960","last_updated":"2024-06-11T17:01:02Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T06:01:44Z","title":"Open-Vocabulary Segmentation with Unpaired Mask-Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08960","snapshot_observed_at":"2026-08-07T11:08:45.066926Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.066926Z"},"links":{"cited_paper":"/paper/2402.08960","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:f4e9061acc3d5b646061bae7b132419931e28d9a3d8d555e2e2be8abf15cfe24","observation_id":"07a56731-bf64-4a31-adb2-3fa73e7968cd","resolution":{"observed_at":"2026-08-07T11:08:45.066926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T11:08:45.197404Z","title":"Xia, Quoc Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.197404Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:581442c2bf8f009e6ecee97cfcf28d1721c9528699381b7d48426e80f6c8b7c6","observation_id":"6d5f953e-df5d-464b-891d-3f3984db2244","resolution":{"observed_at":"2026-08-07T11:08:45.197404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09193","last_updated":"2023-11-15T18:39:21Z","snapshot_observed_at":"2026-08-02T16:45:54.807090Z","submitted_at":"2023-11-15T18:39:21Z","title":"The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09193","snapshot_observed_at":"2026-08-07T11:08:45.273322Z","title":"Gee, and Yixin Nie","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.273322Z"},"links":{"cited_paper":"/paper/2311.09193","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:288526bfde9c5700b727471c6e6e42b89e224cadb7d27ac60feae72c279c793a","observation_id":"9aa33499-ec22-44ca-8371-05a812bd4fe2","resolution":{"observed_at":"2026-08-07T11:08:45.273322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12488","last_updated":"2024-07-23T07:14:54Z","snapshot_observed_at":"2026-08-06T06:23:50.067999Z","submitted_at":"2024-03-19T06:54:33Z","title":"DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12488","snapshot_observed_at":"2026-08-07T11:08:45.339504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.339504Z"},"links":{"cited_paper":"/paper/2403.12488","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:8267af2f9661205df20dc36616374d66dccfc85fb4d20f0fc4b1a80579dad7d7","observation_id":"b54b7879-cd9e-4278-a8fd-3b4d1c1f13f1","resolution":{"observed_at":"2026-08-07T11:08:45.339504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-09T00:23:13.621738Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10332","snapshot_observed_at":"2026-08-07T11:08:45.397760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.397760Z"},"links":{"cited_paper":"/paper/2411.10332","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:fe406bb9bb8d4d790d356254a33cb3fd5392ff2d2d4fa902c0a963df4df45a84","observation_id":"e62bb179-dca9-4451-af74-35c82c258d88","resolution":{"observed_at":"2026-08-07T11:08:45.397760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08879","last_updated":"2024-12-16T03:16:59Z","snapshot_observed_at":"2026-07-06T20:05:36.919481Z","submitted_at":"2024-12-12T02:27:46Z","title":"Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark","version":2},"cited_work":{"arxiv_id":"2412.08879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08879","snapshot_observed_at":"2026-08-07T11:08:47.678497Z","title":"Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark","venue":"cs.CV","work_id":"3732f97b-f0d0-4534-b7d0-2bd9d45521c0","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.459689Z"},"links":{"cited_paper":"/paper/2412.08879","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:842c42c2e5481b3764af5b6786f0239a9939aa7e32fdb897ca3cba819447e602","observation_id":"0cdca2a2-1491-42a1-84a2-f137d4b60ea8","resolution":{"observed_at":"2026-08-07T11:08:47.792006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:51.228530Z","title":null,"venue":null,"work_id":"27b2c574-4068-4694-8e30-7a421c43841c","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.523531Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:37a468c687dae2cdcc1688ab9e74eab1422fd54a1ee3f4f9ee1b7c7840c14743","observation_id":"51cb02f5-cad9-44dd-bbc9-01845a6243e2","resolution":{"observed_at":"2026-08-07T11:08:51.301911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:50.934342Z","title":null,"venue":null,"work_id":"b5199a8e-05b4-4c61-a1d1-81eeeb1ea43f","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.602039Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:cf14644e83d43bb58564a45538ed6ebf479705812dfcddd3f8bd2e95ad261b52","observation_id":"a2e3dec0-6585-4e5c-8a44-a33bd8395fcc","resolution":{"observed_at":"2026-08-07T11:08:51.086971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T11:08:45.712931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.712931Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:544b3761b52e48a9140669c70730beed50171cedf8b0b44daf2c9591b63c20cc","observation_id":"7d3edb90-745d-4e70-ad13-949b3b486d8d","resolution":{"observed_at":"2026-08-07T11:08:45.712931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:50.731541Z","title":null,"venue":null,"work_id":"e282b1c7-97ef-4008-8053-aa3046000dc0","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.811259Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:d39a7d8e76528c4df9e5b68598e616cf6e37eccbc23e798e92370667bf4884f9","observation_id":"a5ccdc74-a977-4c00-bfe6-279859639c39","resolution":{"observed_at":"2026-08-07T11:08:50.838207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:50.468058Z","title":null,"venue":null,"work_id":"372f5691-24c0-4ddb-aea8-b9dd9ce9d512","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.874839Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:14040dbef07f8b9ca85ed71413eb8609da3601423bf4fbca8370ebde9e4561fc","observation_id":"6e8370fa-e4b9-496a-83dd-5abf89a01f1a","resolution":{"observed_at":"2026-08-07T11:08:50.591962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:50.251425Z","title":null,"venue":null,"work_id":"0c3c3bc5-e3be-4b6b-a197-3a412f8299df","year":2021},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:45.955480Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:e89a4c159458343d219029fef9fdbf83cb9270d8d56fd02fa01bc735cc2b147c","observation_id":"74d27c5d-3e66-4841-823a-d5a35c83a16f","resolution":{"observed_at":"2026-08-07T11:08:50.368405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T11:08:46.024434Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.024434Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:75fa2c85988a38130d5f51dd683934781d7b47479b2d10ac57943f691f650545","observation_id":"f6460ecc-2516-46b6-8951-e023a26d0931","resolution":{"observed_at":"2026-08-07T11:08:46.024434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:49.977092Z","title":null,"venue":null,"work_id":"ab760eca-da5c-4837-b069-b704db4fee15","year":2025},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.080861Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:82d0d3e97456f6ac9a351baad0957a4e8883daad4b2216cdc5834898914ad068","observation_id":"ce95bdd1-bec3-4e60-a458-dfa9cc0aaec8","resolution":{"observed_at":"2026-08-07T11:08:50.131375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:49.722822Z","title":null,"venue":null,"work_id":"16d7e0be-5b74-4fdc-aebf-3c654049af9e","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.216434Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:ef855070b5c4fc0451b4ec4cea30b2702b00d74c00419c64cdefe27ead43e975","observation_id":"1af5bb6a-a3d7-4a4d-b806-8c0e4ecfae47","resolution":{"observed_at":"2026-08-07T11:08:49.859512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:49.501933Z","title":null,"venue":null,"work_id":"15aada82-b0f5-404e-8b85-df84b3134cd7","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.357132Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:48623b580dd7495c08d8b7998921186a97d007e8f101fd62688859377bf66e4e","observation_id":"7f8f49d4-b716-4bba-9456-e474910fbc0c","resolution":{"observed_at":"2026-08-07T11:08:49.617597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:49.302315Z","title":null,"venue":null,"work_id":"62c6fc04-cbff-4571-accf-7b9a7fd9f315","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.504809Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:4622c979c258151f2194924b941ee2af7e7c36515ba6d6c131a2b264a0b6ebe8","observation_id":"30762b84-bfb6-40ed-9b56-44f745255e11","resolution":{"observed_at":"2026-08-07T11:08:49.407536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13872","last_updated":"2024-05-29T02:24:36Z","snapshot_observed_at":"2026-08-03T12:37:51.928616Z","submitted_at":"2024-05-22T17:56:51Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13872","snapshot_observed_at":"2026-08-07T11:08:46.629692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.629692Z"},"links":{"cited_paper":"/paper/2405.13872","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:b1c117fa18ca11e045948ec9c551687d0ef375b2a8146980ce036c4b935b6c5b","observation_id":"b0b74032-a9cf-4e96-b770-10ae30cdb709","resolution":{"observed_at":"2026-08-07T11:08:46.629692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T11:08:46.785107Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.785107Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:8ee841083ce040e08129061408a1b4114ed3cd128476a1fcb5670923706d0369","observation_id":"ad0ceb4c-2c7f-4b19-9b02-a574aa1b35a1","resolution":{"observed_at":"2026-08-07T11:08:46.785107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:49.139663Z","title":null,"venue":null,"work_id":"4acdc174-8c46-4c8f-8864-383da3d1f3ef","year":2023},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:46.880493Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:f704e9c840f763bbda7b141686a1e42e9fd2f4272af8a7d993e0bca3e0f198e2","observation_id":"30acb137-6da1-4085-9efb-e2691c641a7f","resolution":{"observed_at":"2026-08-07T11:08:49.214546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:48.805662Z","title":null,"venue":null,"work_id":"8c3e60a5-75f5-493e-ab41-027ab2621c6c","year":2022},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:47.023203Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:f7f3f97121aeca1d6c55d0e3a768e6e6ca72a6692956a9c7cb5b401d43a5bf59","observation_id":"3f162f72-5613-42d6-a8d9-85c338a50d2f","resolution":{"observed_at":"2026-08-07T11:08:48.965251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:48.439527Z","title":null,"venue":null,"work_id":"3f739c47-cb59-444d-9ff2-f53fda4aa157","year":2024},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:47.113216Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:a8c9951a8182c24bd1874763bbc9e61c18948f6532681373acfc836d93982616","observation_id":"584af511-db2a-4278-891a-eaf7fb72764c","resolution":{"observed_at":"2026-08-07T11:08:48.633512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:47.214335Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:47.214335Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:66101bc8dc7e25248a967bd3c0ac078f66dadb6cd0fb45c59be709b549c70a4c","observation_id":"45e7b5e3-81bc-4183-babd-a1581b8e9909","resolution":{"observed_at":"2026-08-07T11:08:47.214335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:47.365596Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:08:47.365596Z"},"links":{"citing_paper":"/paper/2506.04277"},"observation_digest":"sha256:bf0c6dc5129ee56b31bf0c7a575ff4469e80feb0b86c91e67040012c7db87fa6","observation_id":"b80bce5c-b602-4db9-862e-9dbc50ccd111","resolution":{"observed_at":"2026-08-07T11:08:47.365596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04277","last_updated":"2025-06-04T02:07:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T00:24:14.923163Z","submitted_at":"2025-06-04T02:07:40Z","title":"RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 7 inbound Pith citation observations for arXiv:2506.04277."}