{"as_of":"2026-08-07T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76c0544f221f0c73fd04c72d47e937b3f9207777bee5908097c94a19a7ec1908","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:52:38.984260Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T18:13:49.304240Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:b231dc7808eb694c208cc3fa1cf629dddfad5863ec6de7ab949ce94d551a518a","observation_id":"99305b33-8589-4c07-9df4-c17ffe475cc8","resolution":{"observed_at":"2026-05-20T13:03:58.147228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:56:25.331304Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2408.00714"},"observation_digest":"sha256:c8ffe205be3c13b49d84b37ebc04d0b7ecd95454b2cc3d924b55b4466a291c3a","observation_id":"0ff62b57-678d-45e7-b2a5-9c5b361a04b4","resolution":{"observed_at":"2026-05-10T13:56:25.371685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2410.04960","last_updated":"2026-06-04T11:59:03Z","snapshot_observed_at":"2026-08-02T12:51:51.839797Z","submitted_at":"2024-10-07T11:59:54Z","title":"On Efficient Variants of Segment Anything Model: A Survey","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T19:42:24.122342Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2410.04960"},"observation_digest":"sha256:96ab2c09b797d5977587a3750d32a9aaa42d6892f561a3d0567ad0595e07b379","observation_id":"aad9540f-c6dd-42f1-a3a4-4ce68d8109d5","resolution":{"observed_at":"2026-05-23T19:43:23.490908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T08:25:01.468957Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2411.15115"},"observation_digest":"sha256:58a1f53eac1889f95cfe259c2cd1d35ae757095d0de9d956e3c5167d3a51cd2b","observation_id":"dbfacbdb-dc75-4c8f-93df-277c442ea72b","resolution":{"observed_at":"2026-05-23T08:25:29.380265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T11:52:38.984260Z","title":"Segment and track anything.arXiv:2305.06558, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01304","last_updated":"2025-06-02T04:30:14Z","snapshot_observed_at":"2026-08-07T11:42:31.580083Z","submitted_at":"2025-06-02T04:30:14Z","title":"SAM-I2V: Upgrading SAM to Support Promptable Video Segmentation with Less than 0.2% Training Cost","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:38.984260Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.01304"},"observation_digest":"sha256:9ec361fab1db6269028439963c0965d85a3f6a81d412beb33c57b7cb2e49166c","observation_id":"9b1cc4fd-526c-497a-b21e-a3484ac88c49","resolution":{"observed_at":"2026-08-07T11:52:38.984260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T10:50:50.093556Z","title":"Zeqi Gu, Wenqi Xian, Noah Snavely, and Abe Davis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04228","last_updated":"2025-06-04T17:59:58Z","snapshot_observed_at":"2026-08-07T10:42:55.229411Z","submitted_at":"2025-06-04T17:59:58Z","title":"LayerFlow: A Unified Model for Layer-aware Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:50.093556Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.04228"},"observation_digest":"sha256:707df3e67a3ce96b06b6bf456039d5ea8a7b5e60476444bb31bc1a5a4b7692af","observation_id":"29f7552e-8ec6-4694-ac33-60863cf5c5c7","resolution":{"observed_at":"2026-08-07T10:50:50.093556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T10:28:09.287312Z","title":"Segment and track anything.arXiv preprint arXiv:2305.06558, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05302","last_updated":"2025-06-05T17:51:39Z","snapshot_observed_at":"2026-08-07T10:19:12.341695Z","submitted_at":"2025-06-05T17:51:39Z","title":"Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:09.287312Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.05302"},"observation_digest":"sha256:1ac1d9455353192b46f4d0087f5162d05d1e152592f0a1b8952cb323429d5baa","observation_id":"917015bf-08bc-43be-87e3-d8b9bc2d7aa5","resolution":{"observed_at":"2026-08-07T10:28:09.287312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T00:34:20.234594Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-07T09:47:12.291581Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":164,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:20.234594Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:102eaaa5918c6d22f88ea7e190bebc58ed3102081dd8765e5d30ac32af169d2b","observation_id":"736f90f5-e8ac-4755-8c8e-9cca77784074","resolution":{"observed_at":"2026-08-07T00:34:20.234594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T21:58:20.179134Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T10:51:43.961246Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.179134Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:7fdad4f5342df733abd93c24b2175d3a807de5eea57f670653b83e97b1c05f28","observation_id":"9fb9494b-f604-4bec-bb6a-b100b8452b68","resolution":{"observed_at":"2026-08-06T21:58:20.179134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T21:53:32.123934Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23121","last_updated":"2025-07-14T02:03:48Z","snapshot_observed_at":"2026-08-06T21:46:18.776144Z","submitted_at":"2025-06-29T07:05:27Z","title":"CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:32.123934Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.23121"},"observation_digest":"sha256:fec2050512d5a63ac20da7ac11e793923d2dc9266c3ed3fab8d9a7a621ffa1c3","observation_id":"ee9369df-9b15-406f-94ae-1f7bc5d66af0","resolution":{"observed_at":"2026-08-06T21:53:32.123934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T20:40:06.711380Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02294","last_updated":"2025-07-03T04:06:04Z","snapshot_observed_at":"2026-08-06T20:30:26.117596Z","submitted_at":"2025-07-03T04:06:04Z","title":"ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:40:06.711380Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2507.02294"},"observation_digest":"sha256:da16c862a2001d1677e5069555a79f129dfc07b8618b9912ced933da5ee65952","observation_id":"fe661157-e11b-41fb-83bf-d5599062b8c6","resolution":{"observed_at":"2026-08-06T20:40:06.711380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T20:31:50.844918Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02479","last_updated":"2025-07-03T09:36:44Z","snapshot_observed_at":"2026-08-06T20:40:58.005114Z","submitted_at":"2025-07-03T09:36:44Z","title":"CrowdTrack: A Benchmark for Difficult Multiple Pedestrian Tracking in Real Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:31:50.844918Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2507.02479"},"observation_digest":"sha256:f4a3f7ade5fc6aac11dac8f3396cbd7fae147196d14ad21aeb0957f65cb2e51f","observation_id":"0dc380bd-5ec3-4a86-9b19-408a2abb5427","resolution":{"observed_at":"2026-08-06T20:31:50.844918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T14:44:58.782053Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18023","last_updated":"2025-07-24T01:48:50Z","snapshot_observed_at":"2026-08-06T14:36:27.853085Z","submitted_at":"2025-07-24T01:48:50Z","title":"High-fidelity 3D Gaussian Inpainting: preserving multi-view consistency and photorealistic details","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:58.782053Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2507.18023"},"observation_digest":"sha256:210e3f1ae9c89e5607a075b0f3b2b96c5d117564fe26218221b36c8c8a59b148","observation_id":"9cdf3218-26e9-44f6-b31c-a370dfcdc5a4","resolution":{"observed_at":"2026-08-06T14:44:58.782053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T21:57:09.363139Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07747","last_updated":"2025-08-11T08:27:57Z","snapshot_observed_at":"2026-08-05T21:56:40.030550Z","submitted_at":"2025-08-11T08:27:57Z","title":"Grouped Speculative Decoding for Autoregressive Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:57:09.363139Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.07747"},"observation_digest":"sha256:bca835d0facff783b420458613d748afe2cf1deb1b7986a0583e4912226730ee","observation_id":"e23316d3-68b9-4291-b465-fdcda0340cb3","resolution":{"observed_at":"2026-08-05T21:57:09.363139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T22:29:52.721427Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08320","last_updated":"2025-08-09T12:22:40Z","snapshot_observed_at":"2026-08-05T22:29:51.100733Z","submitted_at":"2025-08-09T12:22:40Z","title":"Representative Volume Element: Existence and Extent in Cracked Heterogeneous Medium","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:29:52.721427Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.08320"},"observation_digest":"sha256:d57fbbf1ce9c186f7596aa88fef80e79cb2355b22a59fe0953f347c7907b6f8d","observation_id":"538a1d52-85c3-4e25-be6c-d8fa0183b243","resolution":{"observed_at":"2026-08-05T22:29:52.721427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T16:41:08.620285Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.10934"},"observation_digest":"sha256:a58d38c5bc904c6172c1fed089662547fcad1923fa847477e7bec873de910060","observation_id":"f9e0e54b-bce0-41ea-a5b5-a435ff99900e","resolution":{"observed_at":"2026-05-16T16:41:08.664360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T18:34:23.512742Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14465","last_updated":"2025-08-20T06:40:34Z","snapshot_observed_at":"2026-08-06T07:23:12.156966Z","submitted_at":"2025-08-20T06:40:34Z","title":"DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T18:34:23.512742Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.14465"},"observation_digest":"sha256:8e5ebec131a070faf2b9e59efbf98f65695174613af0d75f855fd3a03329f21c","observation_id":"bb55ce6e-db0c-41a4-9ca2-2c958af88378","resolution":{"observed_at":"2026-08-05T18:34:23.512742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T14:01:16.517409Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-05T14:01:14.646681Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.517409Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:22ab02d65caebdb11bed559751ee3c767e539713a32b48851a3d2a4f9d0b0c84","observation_id":"d3d34e96-2a6a-4207-a531-14fd3f85fee9","resolution":{"observed_at":"2026-08-05T14:01:16.517409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T00:05:11.934372Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06201","last_updated":"2025-09-07T20:28:21Z","snapshot_observed_at":"2026-08-06T02:14:45.331766Z","submitted_at":"2025-09-07T20:28:21Z","title":"Grasp-MPC: Closed-Loop Visual Grasping via Value-Guided Model Predictive Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:11.934372Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2509.06201"},"observation_digest":"sha256:451ff85b9f116f6ffa862a463d9851964f527f54c26414e8660442f78e3e5b7a","observation_id":"22ef0701-514c-41be-a049-6a883b793cc2","resolution":{"observed_at":"2026-08-05T00:05:11.934372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-04T20:44:40.124432Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08354","last_updated":"2025-09-10T07:44:12Z","snapshot_observed_at":"2026-08-04T20:44:29.430006Z","submitted_at":"2025-09-10T07:44:12Z","title":"Grasp Like Humans: Learning Generalizable Multi-Fingered Grasping from Human Proprioceptive Sensorimotor Integration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:40.124432Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2509.08354"},"observation_digest":"sha256:bf999e315cbdfa7dc4d04930cde3dc013ad968505dad012ce411708f38e076d2","observation_id":"31a06d06-832b-4879-b307-bd7cd3992c96","resolution":{"observed_at":"2026-08-04T20:44:40.124432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-04T17:25:30.813136Z","title":"Cheng, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10948","last_updated":"2025-09-13T19:10:35Z","snapshot_observed_at":"2026-08-04T17:25:24.156060Z","submitted_at":"2025-09-13T19:10:35Z","title":"ViSTR-GP: Online Cyberattack Detection via Vision-to-State Tensor Regression and Gaussian Processes in Automated Robotic Operations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:25:30.813136Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2509.10948"},"observation_digest":"sha256:087a345004b49a648f463d0a1be511af39ca49d34a67222c949710b57e9795de","observation_id":"51f54a4b-81d8-4b67-b2c5-cbcaa0599749","resolution":{"observed_at":"2026-08-04T17:25:30.813136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2510.14244","last_updated":"2026-05-12T20:27:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-16T02:55:04Z","title":"Reinforcement Learning for Unsupervised Domain Adaptation in Spatio-Temporal Echocardiography Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T06:53:21.438159Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2510.14244"},"observation_digest":"sha256:864e5be4fcc0f4e155bc72515af542923a8d053a9176fdaa48e7f5dffada51a1","observation_id":"8f735f20-1c5b-47cb-8360-7803ec16e0e9","resolution":{"observed_at":"2026-05-18T06:56:01.667572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2512.17445","last_updated":"2026-04-08T21:08:41Z","snapshot_observed_at":"2026-07-06T22:39:33.919723Z","submitted_at":"2025-12-19T10:57:03Z","title":"LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T20:56:58.770875Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2512.17445"},"observation_digest":"sha256:3efaada1418d2c4c94e5d4af78312ff2a3993e29921fb405cbb9442b8ad26a24","observation_id":"638f907f-54be-4905-87a0-ba068f0665b0","resolution":{"observed_at":"2026-05-16T20:58:31.814788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-03T00:02:11.238949Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-05T10:01:02.742069Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.238949Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:a45a97654faa98593db13864dc07783bd05ecc768681816694035ada8913cc7a","observation_id":"c67fe298-7b32-47f0-aff3-30da96baf5c1","resolution":{"observed_at":"2026-08-03T00:02:11.238949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-07-13T18:24:58.428701Z","title":"arXiv:2305.06558 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.25168","last_updated":"2026-06-26T05:47:15Z","snapshot_observed_at":"2026-07-13T18:24:45.051987Z","submitted_at":"2026-03-26T08:37:32Z","title":"ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T18:24:58.428701Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2603.25168"},"observation_digest":"sha256:bd771d5cd6b7946848e8b1fef7665e6f4ca96bff75dc31822f09c556025b992f","observation_id":"8ec5f0ab-ef26-47f4-8ee7-153c2e331ded","resolution":{"observed_at":"2026-07-13T18:24:58.428701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2604.08546","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:59:57Z","title":"When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:26.420463Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2604.08546"},"observation_digest":"sha256:c35a0c446722050f19983971b8f7731e80a8b512e4d1e06ca085fa4b0d3fe956","observation_id":"521aac84-4e08-43cf-ad2c-a24e5a4ea3b5","resolution":{"observed_at":"2026-05-11T00:10:53.007612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2604.20305","last_updated":"2026-04-22T08:06:32Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T08:06:32Z","title":"AdaTracker: Learning Adaptive In-Context Policy for Cross-Embodiment Active Visual Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T00:34:26.106672Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2604.20305"},"observation_digest":"sha256:f1a0b47cdbaedbf28f122ebdffb6c39673900ebac273e69c8960842fd40f7951","observation_id":"b755e582-44c9-4a1b-85f9-40414dcdad08","resolution":{"observed_at":"2026-05-10T00:34:47.308672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-08-06T21:26:24.889698Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:984e1fd10ce927dd192dec30db1e1091a3a8145ffcbc41a64b0dbf1fc0ebd842","observation_id":"119424ae-d507-4a02-a73c-9eb699106c1d","resolution":{"observed_at":"2026-05-11T20:31:11.807561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2606.27655","last_updated":"2026-06-26T02:18:43Z","snapshot_observed_at":"2026-08-03T19:51:24.471845Z","submitted_at":"2026-06-26T02:18:43Z","title":"Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-29T05:13:51.469018Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2606.27655"},"observation_digest":"sha256:190497619fe722e769f7b23bd89f19757a12e80193c2478cf21f9239f11d11ee","observation_id":"456f231d-bb91-41ed-b7cc-04ac797e0193","resolution":{"observed_at":"2026-06-29T18:13:49.306052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T00:48:38.659879Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03147","last_updated":"2026-08-05T06:08:54Z","snapshot_observed_at":"2026-08-07T11:37:27.951826Z","submitted_at":"2026-08-04T05:24:05Z","title":"CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:48:38.659879Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2608.03147"},"observation_digest":"sha256:ca82368199d9316831672aa71e52b2c60975a0ba908f3a29bf0a3ed2a4d1a69c","observation_id":"bfbb65b8-fc5d-4102-8d79-1dc80c1f94fd","resolution":{"observed_at":"2026-08-06T00:48:38.659879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.06558/citation-record","integrity":"/paper/2305.06558/integrity","json":"/paper/2305.06558/citation-record.json","paper":"/paper/2305.06558"},"outbound":[],"paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2305.06558."}