{"as_of":"2026-08-08T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab5442c17739beba3d59f954320d39af1d54f123a4bec4813a05b33d05d7de91","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:02:31.527586Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:06:33.139310Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T05:30:58.338283Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"cited_work":{"arxiv_id":"2505.16594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16594","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal object captioning for street scene videos from lidar tracks","venue":null,"work_id":"018c51c9-4558-4f00-80bb-3a1dfb2b5b60","year":2025},"citing_paper":{"arxiv_id":"2604.08337","last_updated":"2026-04-09T15:10:25Z","snapshot_observed_at":"2026-08-03T10:29:21.842229Z","submitted_at":"2026-04-09T15:10:25Z","title":"InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:33.139310Z"},"links":{"cited_paper":"/paper/2505.16594","citing_paper":"/paper/2604.08337"},"observation_digest":"sha256:29f2e4368b2dc0d4ec710322ffa9d460b8af7cc43e46253de84b1dfbb2910ec2","observation_id":"11b69413-3366-4aa4-99e1-a5a6081f42eb","resolution":{"observed_at":"2026-05-11T05:30:58.341882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16594/citation-record","integrity":"/paper/2505.16594/integrity","json":"/paper/2505.16594/citation-record.json","paper":"/paper/2505.16594"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.16839","last_updated":"2023-08-09T05:39:34Z","snapshot_observed_at":"2026-07-06T15:09:36.509406Z","submitted_at":"2023-03-29T16:42:30Z","title":"MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16839","snapshot_observed_at":"2026-08-07T15:02:28.003967Z","title":"Mammut: A simple architecture for joint learning for multimodal tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.003967Z"},"links":{"cited_paper":"/paper/2303.16839","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:ddfac1d122550658a597310bd9bcca40e77905f7f5cd04d81a2fea54d0011a00","observation_id":"6a669fc7-60d9-4fb6-934c-512dd9d7dfc8","resolution":{"observed_at":"2026-08-07T15:02:28.003967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13167","last_updated":"2023-05-22T15:54:22Z","snapshot_observed_at":"2026-08-05T23:33:04.454032Z","submitted_at":"2023-05-22T15:54:22Z","title":"VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13167","snapshot_observed_at":"2026-08-07T15:02:28.118849Z","title":"Vlab: Enhancing video language pre- training by feature adapting and blending,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.118849Z"},"links":{"cited_paper":"/paper/2305.13167","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:7df9d7571410a5cdd60c739a8709ba2e09fa08ab13f8b5f6bba0d19fbfc460fa","observation_id":"b6247258-8cda-4e7a-a7c6-2fc1cfed444c","resolution":{"observed_at":"2026-08-07T15:02:28.118849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:34.334307Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset,","venue":null,"work_id":"8d7a3b77-04bb-4138-883b-c5ed645f7a16","year":null},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.210380Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:66b62839d85962a850dda74444f402abfaa96f6cdddca23f2e0fb677cb5ff574","observation_id":"3b89894d-f481-4bf4-bdc6-2a0216f92b91","resolution":{"observed_at":"2026-08-07T15:02:34.415561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03597","last_updated":"2019-04-07T07:27:37Z","snapshot_observed_at":"2026-07-06T07:44:24.766094Z","submitted_at":"2019-04-07T07:27:37Z","title":"Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics","version":1},"cited_work":{"arxiv_id":"1904.03597","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.03597","snapshot_observed_at":"2026-08-07T15:02:32.272359Z","title":"Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics","venue":"cs.CV","work_id":"8eb325bd-a583-4039-9be2-f1239ff415e7","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.384506Z"},"links":{"cited_paper":"/paper/1904.03597","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:8e6f0bd1b47993e12796582e19aa6b6c8e4028ddd667755410ed17338dc2722d","observation_id":"e6e64717-ff25-49de-8e4f-328ddcff60d6","resolution":{"observed_at":"2026-08-07T15:02:32.305348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.01278","last_updated":"2019-08-13T08:31:13Z","snapshot_observed_at":"2026-08-05T10:37:40.453159Z","submitted_at":"2019-05-03T17:20:55Z","title":"Unsupervised Pre-Training of Image Features on Non-Curated Data","version":3},"cited_work":{"arxiv_id":"1905.01278","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.01278","snapshot_observed_at":"2026-08-07T15:02:32.092238Z","title":"Unsupervised Pre-Training of Image Features on Non-Curated Data","venue":"cs.CV","work_id":"e8bed5c1-be12-4d20-bb93-20be9ad30da3","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.503146Z"},"links":{"cited_paper":"/paper/1905.01278","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:fb4fe7e4b07393607b72bb3d93301d3c0a55c949f7baef02e04083a76ad5f581","observation_id":"4f7c5dd5-252b-4021-9d20-722220d3cc6c","resolution":{"observed_at":"2026-08-07T15:02:32.192245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:34.226065Z","title":"Melanoma thick- ness prediction based on convolutional neural network with vgg-19 model transfer learning,","venue":null,"work_id":"43984e18-7e4b-4347-92ba-354fbe182556","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.606666Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:4653c47c57fcb3819a7bb4e9b2db62196dad941fc228b11bae564624539b8f67","observation_id":"b997e172-681e-4e16-924d-19d87ae7e4c3","resolution":{"observed_at":"2026-08-07T15:02:34.280853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:34.059999Z","title":"Pre-training on grayscale imagenet improves medical image classification,","venue":null,"work_id":"e2e74270-a1ed-4de5-99a3-3651bc9511b1","year":2018},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.716523Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:1ce46c4f43c6bd369a2fcd99819891e8616f1c86a5b15b8ef684ec155c29b6a8","observation_id":"9e3a94ff-32d1-4c6f-bc57-f825a6be1c7f","resolution":{"observed_at":"2026-08-07T15:02:34.149539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00212","last_updated":"2019-11-01T05:53:50Z","snapshot_observed_at":"2026-07-06T08:33:58.970043Z","submitted_at":"2019-11-01T05:53:50Z","title":"Low-Rank HOCA: Efficient High-Order Cross-Modal Attention for Video Captioning","version":1},"cited_work":{"arxiv_id":"1911.00212","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.00212","snapshot_observed_at":"2026-08-07T15:02:31.959496Z","title":"Low-Rank HOCA: Efficient High-Order Cross-Modal Attention for Video Captioning","venue":"cs.LG","work_id":"daa53820-a78b-48d9-a1e0-e5dc8dc45622","year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.782114Z"},"links":{"cited_paper":"/paper/1911.00212","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:24c6e00062386f777ecafea2276756f379496c80ae3d6453a5abfafe6f3611ec","observation_id":"76007362-10d8-40c1-a4fc-dd3890e65c39","resolution":{"observed_at":"2026-08-07T15:02:32.020124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.952225Z","title":"Sensor-augmented egocentric- video captioning with dynamic modal attention,","venue":null,"work_id":"832166c8-d922-4a34-bea5-3f9ea5f34b39","year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.879984Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:d040bed3ca8f1dffc6995c105a8a640e9c70e49057c902d86ea677b8116013f5","observation_id":"2f3fedb6-ae83-4424-bcc7-ae7b5f82b368","resolution":{"observed_at":"2026-08-07T15:02:33.986897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.11707","last_updated":"2022-02-01T19:17:11Z","snapshot_observed_at":"2026-07-06T11:32:13.400998Z","submitted_at":"2021-07-25T01:32:02Z","title":"Boosting Video Captioning with Dynamic Loss Network","version":3},"cited_work":{"arxiv_id":"2107.11707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.11707","snapshot_observed_at":"2026-08-07T15:02:31.766144Z","title":"Boosting Video Captioning with Dynamic Loss Network","venue":"cs.CV","work_id":"bbc7a923-4cde-47f8-b63f-216b3efe94e7","year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.972803Z"},"links":{"cited_paper":"/paper/2107.11707","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:56884424ddea20e93ef3952b2a3702e4debe7110ebd8174132af0261f2d19d23","observation_id":"b5cdd1d4-1dca-4046-ab49-b6c24b18fef1","resolution":{"observed_at":"2026-08-07T15:02:31.865243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.036353Z","title":"Panoptic segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.036353Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:098691ff961573194b60ca747d9c0d035a55c8f17199913d7ee4ba16342b3061","observation_id":"5634ddb2-30e4-4d4d-8e6d-29b3333a1cc4","resolution":{"observed_at":"2026-08-07T15:02:29.036353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.761142Z","title":"An empirical study of context in object detection,","venue":null,"work_id":"e859d2ff-c848-45a2-9334-5b7c6dc1d3cc","year":2009},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.104499Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:cc71afd61946e1b8970d75a080c49c59a29754eb699df0b937ee2902d017b99f","observation_id":"949b1838-94dc-43d9-b8fa-5857cc82c437","resolution":{"observed_at":"2026-08-07T15:02:33.817392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.171195Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.171195Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:cc16a0238e1a010db1de856c0ebc0b80397d61eb7784fb388e8473ca555a175b","observation_id":"afa08809-6553-456f-99cb-ef07545707bb","resolution":{"observed_at":"2026-08-07T15:02:29.171195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T15:02:29.260811Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.260811Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:f414e1bfbda46513d8015af8ef0a96c1052ea5d7ecbd12c939ebf6ec7be4ca83","observation_id":"aa1a084a-51b0-4e57-94fe-f26759cc1cfd","resolution":{"observed_at":"2026-08-07T15:02:29.260811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-01T19:17:08.239976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T15:02:29.351108Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.351108Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:872c9052b31d36d03802e8428566be57e2f8e74dc9a54f3027de042ff5f60e5c","observation_id":"b85f535a-1e35-4405-ac04-20df1c5043b4","resolution":{"observed_at":"2026-08-07T15:02:29.351108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T15:02:29.424508Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.424508Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:bc759d3d5e9e2438c66a9eccc4fd0668224f302bcaf2b8715776685331d2f98f","observation_id":"a9878bc4-bf6a-46ea-a9c2-b4267b312608","resolution":{"observed_at":"2026-08-07T15:02:29.424508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.642993Z","title":"Swinbert: End-to-end transformers with sparse attention for video captioning,","venue":null,"work_id":"97cf9084-416b-442a-a070-9227142df71d","year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.503052Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:4868f29340c67c62d92e3112ae82d63417f73667db6b7f2532e83dc06819f522","observation_id":"9225c940-9e52-4dae-8ea7-c98fe7d9f569","resolution":{"observed_at":"2026-08-07T15:02:33.688236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.406520Z","title":"Lingoqa: Visual question answering for autonomous driving","venue":null,"work_id":"10fd9f86-06d7-4bf8-9f52-ba1697c13c7f","year":null},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.555237Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:ceb12697151b842072426362189b2a4c4b3cf22595aa06698ee62be803341180","observation_id":"2e89f73c-4b20-447d-bb17-e1b31044843a","resolution":{"observed_at":"2026-08-07T15:02:33.524482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.616411Z","title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.616411Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:6fd31e04c8d28e8afa0ce245b479e22ea001fd4e7a0bba5cde27dd9aaff47bfb","observation_id":"a9ad56f4-133c-4ee6-bf79-03698936ac9c","resolution":{"observed_at":"2026-08-07T15:02:29.616411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:33.161672Z","title":"Nuscenes-mqa: Integrated evaluation of captions and qa for autonomous driving datasets using markup annotations,","venue":null,"work_id":"feb50ca9-9c47-4114-979c-f99c48f8033e","year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.651915Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:3d93c5cf4ea9c6d711205616d32ad65b11b5af9b0d0d8ff71779fde7e599d0c1","observation_id":"925d6cbf-a016-4395-9a47-23a0f46b9d60","resolution":{"observed_at":"2026-08-07T15:02:33.264972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04379","last_updated":"2025-03-30T15:11:24Z","snapshot_observed_at":"2026-08-02T02:55:03.543491Z","submitted_at":"2023-09-08T15:21:07Z","title":"Language Prompt for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04379","snapshot_observed_at":"2026-08-07T15:02:29.686171Z","title":"Language prompt for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.686171Z"},"links":{"cited_paper":"/paper/2309.04379","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:b72a69f0b39d33c63d0044a4418fbaf0aa5d62edae2c486c22e2096f6257e8e1","observation_id":"6b766470-5748-44f5-891c-013d71e87bed","resolution":{"observed_at":"2026-08-07T15:02:29.686171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.741400Z","title":"Covla: Comprehensive vision-language-action dataset for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.741400Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:bc8490c4e0d9bcbdf3a25a48e6fafdfd0c819e08833286a721ef7c47967b6a45","observation_id":"25fab8d1-523d-4e0e-9df9-39006acd7f1e","resolution":{"observed_at":"2026-08-07T15:02:29.741400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.802695Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.802695Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:7db1698bdebe5284f560bee2ed01947c1bde623b6f903a4dbf84424e3ee6d517","observation_id":"2b7733b6-b7d0-4bc5-83eb-ee539c7f94d8","resolution":{"observed_at":"2026-08-07T15:02:29.802695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.858783Z","title":"Scalability in perception for autonomous driving: Waymo open dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.858783Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:64bf280529f97ae00665d59b34cdea97c7bb137647c9c62c3ccad5d85931c618","observation_id":"db60efbf-4e4e-445d-92e1-340dcad7f9fc","resolution":{"observed_at":"2026-08-07T15:02:29.858783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:29.930690Z","title":"Kitti-360: A novel dataset and bench- marks for urban scene understanding in 2d and 3d,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.930690Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:c8220c9e7d344b337c8094c5c9680fdabfa7c59e3aaa4e67af349182721a2fd8","observation_id":"a54ae552-4df9-4c06-bf31-587fc7e0a5b6","resolution":{"observed_at":"2026-08-07T15:02:29.930690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T15:02:29.989811Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.989811Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:944f7dcd1194fa9e6085032a18f370464b7899376b88c3602f69092048acfd28","observation_id":"afa8f4a0-e1a6-430d-9fb5-a6d3c098cadd","resolution":{"observed_at":"2026-08-07T15:02:29.989811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.026643Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.026643Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:42458feedd4c3abb9243595f8cb04961fed8dfe640b9b5d01115525e4e7479ae","observation_id":"2dee0491-bba6-46c1-a5e7-7ca30aeaa4df","resolution":{"observed_at":"2026-08-07T15:02:30.026643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.122872Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.122872Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:70a00bdaa03e3e7569463b7b8d0b865427e49ca8984fc303ac3f273305474d00","observation_id":"45e652a9-39a0-4b43-9bc1-48b7e076c746","resolution":{"observed_at":"2026-08-07T15:02:30.122872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.964700Z","title":"Is space-time attention all you need for video understanding?","venue":null,"work_id":"baafb15d-cfc8-4107-9d13-89a511804a29","year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.219968Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:cd3f3389075c6b5a90694ba3da68cb55f9ea009940bed608281937f3a47b95a2","observation_id":"58587ce4-673f-4b34-bd10-5ab51d599d13","resolution":{"observed_at":"2026-08-07T15:02:33.026550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.284228Z","title":"Vivit: A video vision transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.284228Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:efd415eef8523d1ddc8a34b1c0a57b473e8a8f50578cb7d8129cf8d0b78095dc","observation_id":"07fedb53-97ba-4763-a910-ed65e8bc7cb7","resolution":{"observed_at":"2026-08-07T15:02:30.284228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.809008Z","title":"Tuber: Tubelet transformer for video action detection,","venue":null,"work_id":"1851a992-3363-46cf-b115-825bc3aa432d","year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.350333Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:5c716eb336c548d7a1ac2267aa8bdc418c50ca8ab9f0ffa9041c8c3ec3728b5a","observation_id":"dd8bcb5f-5428-46ce-b46f-026b0068a37b","resolution":{"observed_at":"2026-08-07T15:02:32.884734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.423962Z","title":"End-to-end video instance segmentation with transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.423962Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:02de4db9d7e530e38e12679ed437ca343d478f046fee1b29269bf06acc6de197","observation_id":"035c7db7-0b19-416e-906e-ce7a1a86a862","resolution":{"observed_at":"2026-08-07T15:02:30.423962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T15:02:30.614682Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.614682Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:213f331b15f66d34beef167661f0b8973c3117b1a5c4a87833adc33e01d9538f","observation_id":"b5ad08d6-56d4-4d43-95bf-2dd2207e1773","resolution":{"observed_at":"2026-08-07T15:02:30.614682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T15:02:30.732657Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.732657Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:431f2be886d12e3664937787e601043a396663abc8560222a324b6ddb848efa7","observation_id":"27b94720-d27d-4e83-a7e7-a7abde96db36","resolution":{"observed_at":"2026-08-07T15:02:30.732657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:30.839297Z","title":"Adapt: Action-aware driving caption transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:30.839297Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:dca47f9201c8db6737cb9220a57d4ab2c69351bce754bb23f289f1ead45c9d5f","observation_id":"8cb8e2b0-b50f-42e5-94a6-69dda43a7026","resolution":{"observed_at":"2026-08-07T15:02:30.839297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:31.005990Z","title":"Textual explanations for self-driving vehicles,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.005990Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:5034a761a5d620dddb9d5da071d818b99763cacb73d40ad5abdf392a99fca6c5","observation_id":"464de7ee-7eec-4f00-a9b4-cda0ef90f22f","resolution":{"observed_at":"2026-08-07T15:02:31.005990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T15:02:31.081961Z","title":"Internvid: A large-scale video-text dataset for multi- modal understanding and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.081961Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:361f774deea843ea1c0bbf0a3ba14787cca69b15886d28f3e00ea70d7e072f30","observation_id":"8a76d122-1a03-4998-9597-ac78e3d31d83","resolution":{"observed_at":"2026-08-07T15:02:31.081961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:31.163340Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.163340Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:13408e1f6b2b231e39219cdabfc57cd3f6346e6d5ad09d80c1d96d542effee6d","observation_id":"980049bf-5867-40d3-a61d-4ba25b3636a3","resolution":{"observed_at":"2026-08-07T15:02:31.163340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-07T15:02:31.265644Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.265644Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:26abd7cac818daa24bb78fd543c0db15bbaf317c9896a5fa8bc5ab63715439b2","observation_id":"b9b456bb-b459-4b12-83a8-43367164c6c5","resolution":{"observed_at":"2026-08-07T15:02:31.265644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.670756Z","title":"Can masking back- ground and object reduce static bias for zero-shot action recognition?","venue":null,"work_id":"de4f0631-1094-4ebf-aaeb-15ba607932b2","year":2025},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.322555Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:e1b404bd48ac04191761441bb9d3bdd6aac5c22c245d69f2145308ca17e164b9","observation_id":"1cb494fc-6a8a-4209-83c1-d2fbd34d1cd9","resolution":{"observed_at":"2026-08-07T15:02:32.723513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.555549Z","title":"Another efficient algorithm for convex hulls in two dimensions,","venue":null,"work_id":"21a841bb-5a58-4dd0-b0e4-e199ab1ef5a7","year":1979},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.379805Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:bb9017ac1b5a1db47038bb5c915a0912f0f529d9d8095f14f9e31d3e81e971d0","observation_id":"9facd20a-5781-42ff-b0e5-8da5a3718d0e","resolution":{"observed_at":"2026-08-07T15:02:32.612712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:02:32.407077Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"fe7fe25f-4bcb-4188-8aad-5e686c2a74cb","year":2002},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:31.527586Z"},"links":{"citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:c637a65239f5c66b5a810c862adb8db22a11be77a11eef5d189399bfe8609975","observation_id":"b2b4fe5d-c54d-45b9-9f43-7a3d6cf6d9dc","resolution":{"observed_at":"2026-08-07T15:02:32.472030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08345","last_updated":"2025-01-06T09:10:55Z","snapshot_observed_at":"2026-08-07T02:26:34.656486Z","submitted_at":"2023-04-17T15:08:15Z","title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08345","snapshot_observed_at":"2026-08-07T15:02:28.305093Z","title":"Available: https://arxiv.org/abs/2304.08345","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:28.305093Z"},"links":{"cited_paper":"/paper/2304.08345","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:9dffe7a44772ba222da1808f22220786dadbe04d56b234860039f185f10b33af","observation_id":"a349a548-3736-43a6-b28e-36458a90196b","resolution":{"observed_at":"2026-08-07T15:02:28.305093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:55:54.546955Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.16594."}