{"as_of":"2026-08-08T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebfcf28272f0c7a137e1b15b6892aca4035cc60033385f7faf2973e7de0d9fd6","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:55:13.116562Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19743/citation-record","integrity":"/paper/2607.19743/integrity","json":"/paper/2607.19743/citation-record.json","paper":"/paper/2607.19743"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T11:55:09.112671Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.112671Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:97ded5ed9395b9783e63cc5691e811d52de49765b6777ebddbc33c585a755736","observation_id":"8a2dbc7e-fd6c-4d63-8c19-233bcc142f96","resolution":{"observed_at":"2026-08-01T11:55:09.112671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.171350Z","title":"Learning what to learn for video object segmenta- tion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.171350Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:73f1f0b9e0d441f1046bbfd3dd04235bcb897c1a3d68b093240fce215b225bc6","observation_id":"aa074ca9-5d26-43f1-940b-ecf86f027e6c","resolution":{"observed_at":"2026-08-01T11:55:09.171350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.282049Z","title":"One- shot video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.282049Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:7fcb0ef526dd569a00ae296087d0d4d9e734c8841dc83f19a517164fe629a943","observation_id":"1d0de68f-9b07-41d9-a368-41acf1273e7b","resolution":{"observed_at":"2026-08-01T11:55:09.282049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13803","last_updated":"2025-05-31T11:24:10Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T12:50:11Z","title":"M$^3$-VOS: Multi-Phase, Multi-Transition, and Multi-Scenery Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13803","snapshot_observed_at":"2026-08-01T11:55:09.339686Z","title":"M 3-vos: Multi-phase, multi-transition, and multi-scenery video object segmenta- tion.arXiv preprint arXiv:2412.13803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.339686Z"},"links":{"cited_paper":"/paper/2412.13803","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:8557dcd436577ca6293e65cb5542fff09ae1bb4f3569a1e3405433437edfbe32","observation_id":"3c0ee510-43d0-4c02-bca7-0cfd347a7992","resolution":{"observed_at":"2026-08-01T11:55:09.339686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.408481Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.408481Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:d2ca1d51b8cf828cc3ecbd5b75ebfdfa9ccc15eef2d6d9dcc5101d8014b01937","observation_id":"b5640434-1815-46e7-b2a9-37655da1d503","resolution":{"observed_at":"2026-08-01T11:55:09.408481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.505478Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.505478Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:a11cb8e0bdca0244377a0a0bce9b5ea4b0d066dd03b3c4492f49fe2319ac96f8","observation_id":"8415628d-5e06-4aa9-bd55-1fd8f9745b56","resolution":{"observed_at":"2026-08-01T11:55:09.505478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.566402Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100.International Journal of Com- puter Vision, pages 1–23, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.566402Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:f43c624c7987bd5a5ee54a3871c859e77b0176b461e5a8c9be01603587384c2b","observation_id":"06867b1c-c752-490a-ab56-af9a01d8e778","resolution":{"observed_at":"2026-08-01T11:55:09.566402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.630682Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.630682Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:d7917b134b88e7ffc1d9b6966bde2bea36a80f1c0425b71856cb57a46a7157eb","observation_id":"6ad58e50-ad8e-45d7-a97c-3031da828713","resolution":{"observed_at":"2026-08-01T11:55:09.630682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.728034Z","title":"Mose: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.728034Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:ed9b53a53d053bbcc571d28a264bf3ebc2609e3322b2791de43375eae5a25d82","observation_id":"b3210be7-1fc1-44cb-8a6b-97d1e8fbd8ec","resolution":{"observed_at":"2026-08-01T11:55:09.728034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16268","last_updated":"2025-07-29T00:08:01Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:19Z","title":"SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16268","snapshot_observed_at":"2026-08-01T11:55:09.781555Z","title":"Sam2long: Enhancing sam 2 for long video seg- mentation with a training-free memory tree.arXiv preprint arXiv:2410.16268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.781555Z"},"links":{"cited_paper":"/paper/2410.16268","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:27714f931c51185752f967f79d03d03aed0f40560ef23584508c6a1727cb2fb6","observation_id":"d79a414a-a323-4915-86b1-432bf5a333f6","resolution":{"observed_at":"2026-08-01T11:55:09.781555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.843883Z","title":"Event neural net- works","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.843883Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:7145791bdc735554b69574ae443b1884afc3219d098c950e6d079a5df4e26d1f","observation_id":"1bb0a664-994b-4eed-a5ec-ee91f146312c","resolution":{"observed_at":"2026-08-01T11:55:09.843883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.906884Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.906884Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:4561862c2a2e5275bc71d8b45ed31a322dc45e344bf7f0bb6a981c93a966f986","observation_id":"b9d6d769-d358-43b4-8a41-0d8bd77a3d0f","resolution":{"observed_at":"2026-08-01T11:55:09.906884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:09.969824Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:09.969824Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:3f645f2e7b1b3b63936bc390769fb9d5f7edd76a0481e2e3754dab1b3e6fd59d","observation_id":"c55b2d4c-06b9-40a2-8e82-f074a17953ff","resolution":{"observed_at":"2026-08-01T11:55:09.969824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.029885Z","title":"Skip-convolutions for efficient video processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.029885Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:1967d0e97cc38d85ab343124ae912045d589801efe82046404d673afda58f056","observation_id":"cf7417b5-1c2b-4e13-a5d0-8108c94a0fe8","resolution":{"observed_at":"2026-08-01T11:55:10.029885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.118570Z","title":"Delta distillation for ef- ficient video processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.118570Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:63b598d3829c6e85934745ca85aafa6f5347206a3f8f64d524544346a50194d7","observation_id":"42246b8d-38a3-45d2-81ba-a90e3430637d","resolution":{"observed_at":"2026-08-01T11:55:10.118570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.180497Z","title":"Lvos: A benchmark for long-term video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.180497Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:338bd92fe482290c2f10b417e927952cf119edce1dfaef4d55d2540ee37f1fee","observation_id":"9ccf52b5-cc15-4253-9e1a-6bd0739cda0e","resolution":{"observed_at":"2026-08-01T11:55:10.180497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.249402Z","title":"Videomatch: Matching based video object segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.249402Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:90f76bd6c56a594daf9e6762493e7f8a53e2e0f45ed905d9dd241b290f05d9ca","observation_id":"c0c76a2c-6dcb-4f24-a423-ca16ba7b9eb3","resolution":{"observed_at":"2026-08-01T11:55:10.249402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.314385Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.314385Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:c52ea3988ff87a76d44601bbe092013ee19b34ccb23c03c35d8114ec09857903","observation_id":"e9e8e9bd-b887-4b80-8ed9-2bc1e909a785","resolution":{"observed_at":"2026-08-01T11:55:10.314385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.410233Z","title":"Scsampler: Sampling salient clips from video for efficient action recog- nition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.410233Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:39aa87d78b4e5e217d68112237ee4eebf288aebf0f0d7553265c89f53559fd81","observation_id":"e1b6792d-842c-48cd-9e2f-6be9074661c1","resolution":{"observed_at":"2026-08-01T11:55:10.410233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.480170Z","title":"Blade: Learning compositional behaviors from demonstration and language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.480170Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:8602fa8b9eb7921c29a80a26bcd7dbd90698139b81754292236db040e47155bf","observation_id":"7f854cbd-ced3-4689-84bb-6a20a77ac05e","resolution":{"observed_at":"2026-08-01T11:55:10.480170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.512238Z","title":"Mash, spread, slice! learning to manipulate object states via visual spatial progress.arXiv preprint arXiv:2509.24129,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.512238Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:fc1360c0df278f4be726ac51088bda3f80e558e2d9b7cf2837584dfc851665ab","observation_id":"97000b2f-58c0-4844-b857-06b78ca5da5c","resolution":{"observed_at":"2026-08-01T11:55:10.512238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.562673Z","title":"Spoc: Spatially-progressing ob- ject state change segmentation in video, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.562673Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:74a84e4a9ab6f2b5f96e9c8756dbaac470b05fb0f0176db3827e4c202a382498","observation_id":"1abb384b-a092-4b2b-bb3b-0d78c57a9c43","resolution":{"observed_at":"2026-08-01T11:55:10.562673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.627825Z","title":"Video object segmentation without temporal information.IEEE transactions on pattern analysis and machine intelligence, 41(6):1515–1530, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.627825Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:f22a51bf6d9eecc59baeffd5b2af9a9abefe7e85679c34d6263c5b2675fdd36f","observation_id":"43e75ae2-a3c9-49ee-866d-ce714d551207","resolution":{"observed_at":"2026-08-01T11:55:10.627825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.697849Z","title":"A literature review of computer vision techniques in wildlife monitoring.IJSRP, 16:282–295, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.697849Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:48ab65516dbe236f738ae70818b1153fa39c9bb276629c2abfa0f341b2a1a69e","observation_id":"f4e8230c-3053-4ebf-81ee-e0a77fd10d6b","resolution":{"observed_at":"2026-08-01T11:55:10.697849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.819325Z","title":"Fast video object segmentation by reference- guided mask propagation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.819325Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:450b9858ce8edffca3758219d6bda26aa21d56650be42040cc3131ff2228ec9d","observation_id":"4dec266b-5741-45fe-a0ee-153461296471","resolution":{"observed_at":"2026-08-01T11:55:10.819325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.876734Z","title":"Video object segmentation using space-time memory networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.876734Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:e9941f73f4f880a39ce5acbbfbb8f4794bd7b57cc62387c822f9ada3edb663c5","observation_id":"b5f1dfd1-4ef5-43f1-8661-a7a5c4a4d484","resolution":{"observed_at":"2026-08-01T11:55:10.876734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:10.924605Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.924605Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:8d67329e5cda078f5b3c8ea9ef5ba1313072f5d3a4155c2a07b90a9fee514e52","observation_id":"44e2774a-b9d6-4397-a82a-2f4f82a31b07","resolution":{"observed_at":"2026-08-01T11:55:10.924605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-01T11:55:10.968087Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:10.968087Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:f6750ba3d1921cc3fb163b45412cae63a7b9191cc344081ffc3bb74b54ab1e7c","observation_id":"df4682ff-61ed-47fd-bc68-4518d44c06ad","resolution":{"observed_at":"2026-08-01T11:55:10.968087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05776","last_updated":"2023-04-02T22:01:17Z","snapshot_observed_at":"2026-07-31T08:06:57.921225Z","submitted_at":"2022-11-10T18:58:22Z","title":"High-Quality Entity Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05776","snapshot_observed_at":"2026-08-01T11:55:11.059687Z","title":"High-quality entity segmentation.arXiv preprint arXiv:2211.05776, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.059687Z"},"links":{"cited_paper":"/paper/2211.05776","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:712a3d0380dadbb8993d41dc08b3d00ba5356f37773d832d33747d548998f98f","observation_id":"a71abc44-b18f-4f1a-93b6-089704796abd","resolution":{"observed_at":"2026-08-01T11:55:11.059687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-01T11:55:11.215307Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.215307Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:07f50ff91da72bc1a370695939141b73c135b686a40efbc10996c5965010325c","observation_id":"be2f7887-fd6f-4462-b7f4-701fea1dfcef","resolution":{"observed_at":"2026-08-01T11:55:11.215307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.297776Z","title":"The visual object track- ing vot2016 challenge results","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.297776Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:d561bc1d10d9c1f4b3ea9499de59fcc008a2b0c98ff1155739ae51ad0eb1cfef","observation_id":"960e87ca-f89a-4aff-888b-b24522c9c274","resolution":{"observed_at":"2026-08-01T11:55:11.297776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.392497Z","title":"Token turing machines","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.392497Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:fef2c2ead767dbb5fc00f7ce1d356baa0bf3c4e5e5a2ec72f358bf0ff41b8602","observation_id":"707e97e6-c2cd-47d9-8648-db51a93f14b2","resolution":{"observed_at":"2026-08-01T11:55:11.392497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-01T11:55:11.477753Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.477753Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:84d9bdc64e1579392a81d0c862171418d95ecb396df5c9f0e48965d5dffe5d3b","observation_id":"a8f4a119-5ef0-4545-87e6-4b6fc4e5ed8a","resolution":{"observed_at":"2026-08-01T11:55:11.477753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.568889Z","title":"Tracking and understanding object transformations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.568889Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:f9cac75e4643556d4ea27f100b3d40e241b82a9cda91c4e1d98a76a86e6eae55","observation_id":"8d0d70f6-8b79-4828-9a3d-1282ef858430","resolution":{"observed_at":"2026-08-01T11:55:11.568889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.660021Z","title":"Breaking the” object” in video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.660021Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:608117fe61ce6bc7b23696e4e9569fc81b3d8b89e23b476e403c737d83fb2d78","observation_id":"7d43954b-31a3-4899-a24f-12ad72049d98","resolution":{"observed_at":"2026-08-01T11:55:11.660021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.747593Z","title":"A distractor-aware memory for visual object tracking with sam2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.747593Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:96b97b6cbb167b9b6ece025e19c954a7212c1ef0e1eab43771c64020a6528c37","observation_id":"26ec42ed-9de2-4b06-9d66-b9495243f4e4","resolution":{"observed_at":"2026-08-01T11:55:11.747593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.840339Z","title":"Feelvos: Fast end-to-end embedding learning for video object seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.840339Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:485a052f0bb22ad511f5a569d2bcd7045b72139259c156e2072aec4c1bd19abd","observation_id":"929525fd-87d9-4908-b8bc-153174901eec","resolution":{"observed_at":"2026-08-01T11:55:11.840339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:11.946785Z","title":"Adaptive focus for efficient video recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.946785Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:75b97f8081a28df081e4724471c519bdb4d5f5592d67f8ed708a0eac93b78d17","observation_id":"7dfe8420-5782-4432-a505-6d00eefaabcf","resolution":{"observed_at":"2026-08-01T11:55:11.946785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.029372Z","title":"Tracking transforming objects: A benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.029372Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:8ca55cc7f8c3f3c41bd035cf3dd4a0086eeb6d7bba352b24616cfbace14393f6","observation_id":"a47d4fdb-b372-4ce7-9317-ad3716e16f49","resolution":{"observed_at":"2026-08-01T11:55:12.029372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.115537Z","title":"Adaframe: Adaptive frame selection for fast video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.115537Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:cd894275161ee3494c2eb17e59e246097293478355b9546beb83ebc4a2cd7915","observation_id":"111fb18e-add2-4f83-a643-915daa82f3a9","resolution":{"observed_at":"2026-08-01T11:55:12.115537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.213919Z","title":"Efficient track anything","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.213919Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:782c8aa5d9a51b256493cb0cf0acb50aafaf7f5b9bbc2e66497513b747555b44","observation_id":"03865801-13f9-4caa-a751-e859f728910d","resolution":{"observed_at":"2026-08-01T11:55:12.213919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.303996Z","title":"Youtube-vos: Sequence-to-sequence video object segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.303996Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:ea84cba65348e8a16cf97005716c91e355fe63ff8f28aee8e5247a31e807e659","observation_id":"5ce48b93-8211-4296-970d-707ed72f4c5d","resolution":{"observed_at":"2026-08-01T11:55:12.303996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.401325Z","title":"Learn- ing object state changes in videos: An open-world perspec- tive, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.401325Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:5fe2b3d35c783b34ba715c88f819272b479128cdeab59507c29cdee5947719af","observation_id":"73299579-45fd-4bc9-889a-da9246eb8647","resolution":{"observed_at":"2026-08-01T11:55:12.401325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11922","last_updated":"2024-11-30T22:32:34Z","snapshot_observed_at":"2026-08-07T02:44:57.260422Z","submitted_at":"2024-11-18T05:59:03Z","title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11922","snapshot_observed_at":"2026-08-01T11:55:12.500740Z","title":"Samurai: Adapting segment anything model for zero-shot visual tracking with motion-aware memory.arXiv preprint arXiv:2411.11922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.500740Z"},"links":{"cited_paper":"/paper/2411.11922","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:9bb9ad077b3d5df7c11a670cb4f5d0baf40cf6dd8e87ffd85d553edd7879c12a","observation_id":"e7e59353-1601-43bf-a8ba-dfaa5d970eaa","resolution":{"observed_at":"2026-08-01T11:55:12.500740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.593019Z","title":"Efficient video object seg- mentation via network modulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.593019Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:c725495f46897c5ca580472d30a1221136a2751cb0c3ac39f981abef3b1a5c09","observation_id":"ad64c713-bd2c-4008-b0a8-bda4da06154e","resolution":{"observed_at":"2026-08-01T11:55:12.593019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.691476Z","title":"Collaborative video object segmentation by foreground-background inte- gration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.691476Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:b03f0e38b9081184367d89c32f19c6c31172600b10e553ae57e9f371714e799f","observation_id":"eb79461b-0af3-4626-a540-5a30c843f777","resolution":{"observed_at":"2026-08-01T11:55:12.691476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.792068Z","title":"Associating ob- jects with transformers for video object segmentation.Ad- vances in Neural Information Processing Systems, 34:2491– 2502, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.792068Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:6d9ba7f1026ca74d5b54a61613363c77c54972e6233a6d46390c70d828516ffb","observation_id":"a9e80751-2f38-4a99-b663-7556db8d9e0b","resolution":{"observed_at":"2026-08-01T11:55:12.792068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.884011Z","title":"Video state-changing object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.884011Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:be10e4be91ebf94b1b70ef6038832d925b4f6fd7280caf9e2588d1d3b640c2ef","observation_id":"f312575e-f5a8-4706-b840-366e5e12a8ef","resolution":{"observed_at":"2026-08-01T11:55:12.884011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:12.936381Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip.Advances in Neural Information Processing Systems, 36:32215–32234,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:12.936381Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:fa62c12cbf059fbf6a6a1e2392f1a4f2d1c20fe9f12504d9490d73fd8ecb0d58","observation_id":"0fe1e955-8f06-46ef-9fbd-8dcccf533950","resolution":{"observed_at":"2026-08-01T11:55:12.936381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-02T20:38:33.149530Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22779","snapshot_observed_at":"2026-08-01T11:55:13.026221Z","title":"Trajtok: Learning trajectory to- kens enables better video understanding.arXiv preprint arXiv:2602.22779, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:13.026221Z"},"links":{"cited_paper":"/paper/2602.22779","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:557bc7d4c649f9adf46eab872d5f440bf5b2300bde8586cef8d3cb49bdf1a49b","observation_id":"bcdb979b-3065-4091-bddc-b9c315c73e2d","resolution":{"observed_at":"2026-08-01T11:55:13.026221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:55:13.116562Z","title":"Edgetam: On-device track anything model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:13.116562Z"},"links":{"citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:a6c879230f5f0478ea11391e6f2d68355c44e36d032b0249b8636db4aa36336b","observation_id":"ad502b1d-f351-491c-b7ea-4401158d740a","resolution":{"observed_at":"2026-08-01T11:55:13.116562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.19743."}