{"as_of":"2026-08-07T22:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a22ca8b6085967fba50fcfcab914f61dcf3d2e9c3897fe00c8fd7d2f4605b40","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:55:41.858385Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21353/citation-record","integrity":"/paper/2507.21353/integrity","json":"/paper/2507.21353/citation-record.json","paper":"/paper/2507.21353"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:48.393576Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"fdb0f474-264f-4ba6-a858-bcd7bf148b70","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:36.785009Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:10242d9551d77f75623a8bd7308d89ad8ce0caf88a45c39dad632bb2bd31a683","observation_id":"9e6b3f22-96c8-4fdf-bd98-99d6283d1359","resolution":{"observed_at":"2026-08-06T12:55:48.486773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:48.190642Z","title":"Exploiting vlm localizability and semantics for open vocabulary action detection","venue":null,"work_id":"ae7766df-3432-441e-bd81-ba71a449c22d","year":2025},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:36.938943Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:040936ae4f7717fc1d8cf34f0dde5de0bea0054c635817d8826833c09b0d33fe","observation_id":"349e228c-2515-4f54-bef2-3dc0a1259e28","resolution":{"observed_at":"2026-08-06T12:55:48.249842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.952126Z","title":"Frozen feature augmentation for few-shot image classification","venue":null,"work_id":"2674fe88-148f-43db-b5e9-40125511446e","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.050985Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:808a68b60ad7c0acf82113fe255fe5910bc75cabe7561e68668928f0d8bd4138","observation_id":"a4e19a9e-a116-40f2-8a43-dda1673bbca1","resolution":{"observed_at":"2026-08-06T12:55:48.040466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.667713Z","title":"Visualgpt: Data- efficient adaptation of pretrained language models for image captioning","venue":null,"work_id":"0d085837-5f5c-4abf-9cdf-f03f51d5b289","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.167650Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:59c8755bae81d003c132dc5a2b5f315fcc05dd878a1709487a042bb88f9e553d","observation_id":"1315f334-b352-4329-9662-6fdb5718d5f4","resolution":{"observed_at":"2026-08-06T12:55:47.779631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.12171","last_updated":"2021-03-22T20:36:34Z","snapshot_observed_at":"2026-07-06T10:52:18.592274Z","submitted_at":"2021-03-22T20:36:34Z","title":"Adversarial Feature Augmentation and Normalization for Visual Recognition","version":1},"cited_work":{"arxiv_id":"2103.12171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.12171","snapshot_observed_at":"2026-08-06T12:55:42.437168Z","title":"Adversarial Feature Augmentation and Normalization for Visual Recognition","venue":"cs.LG","work_id":"eb03c561-10b6-4ce0-84dc-1861336a0b0e","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.290334Z"},"links":{"cited_paper":"/paper/2103.12171","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:c4f88c6789139b8ec5a4db7617fd4657a88a7aa61d4a75a12ed9c564b0fb7479","observation_id":"fddb37e3-7c7c-4e32-9b25-f5f1054d910e","resolution":{"observed_at":"2026-08-06T12:55:42.537495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-07T16:01:20.593783Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-06T12:55:37.435979Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.435979Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:496f07786e5f34bd0c36948db70c081db94f1fb75e538f40cc4108bfe0784fff","observation_id":"254383df-acec-4f27-a082-f36dbfe6d5b6","resolution":{"observed_at":"2026-08-06T12:55:37.435979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.447058Z","title":"Autoaugment: Learning augmentation strategies from data","venue":null,"work_id":"35853151-84cf-4777-82c7-f333d3c4c925","year":2019},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.606762Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:1703de5b6f4bd3bb0d6fea91040c26774206503fd1e73547d8e14ac129952f28","observation_id":"10f9b7f0-37fe-406c-ae7c-6055b09f2a18","resolution":{"observed_at":"2026-08-06T12:55:47.546084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.254688Z","title":"Clip-adapter: Better vision-language models with fea- ture adapters","venue":null,"work_id":"03f236a7-1f40-4c89-a275-becb4eb3231c","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.752750Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:3edcd8568c6076b713903493cca7d285e75cc88323c965d6d04fd198ecf8ecaf","observation_id":"a1ef18b4-e09c-4fbb-b061-84da64288753","resolution":{"observed_at":"2026-08-06T12:55:47.336907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.049435Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":"c37bb097-db29-4d4a-976b-36a0fed71898","year":2018},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.911344Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:2f3e3b4f6a7323c4e6f138d468f1551782d1abc123f2730d9cff04786ef8bff5","observation_id":"94005041-74c4-4cf2-bfba-70c183cdab04","resolution":{"observed_at":"2026-08-06T12:55:47.133805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:38.054743Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.054743Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:f6693adf107809ec859a8b63ff88048b683a4af26bb2563c97a88b4fbb881e50","observation_id":"f85fcdf5-329b-4cfb-a473-79972efaf6f6","resolution":{"observed_at":"2026-08-06T12:55:38.054743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.795333Z","title":"Interaction-aware prompting for zero-shot spatio-temporal action detection","venue":null,"work_id":"c44eab0c-25a3-4df7-8a35-ec235d552315","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.161397Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:4c137729b19ffab8db989f635970d46887efb04dadcd1bd10697a1da664cb424","observation_id":"db1f0c87-1b3e-4238-9dd2-754a670352ac","resolution":{"observed_at":"2026-08-06T12:55:46.917614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.578766Z","title":"Interaction-aware prompting for zero-shot spatio-temporal action detection","venue":null,"work_id":"6b4299c9-72dd-4874-af22-7a7552eef71f","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.274684Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:414ef2412bc31207bb057e90742c998b6b0bb04a788468edf46919a02cc39669","observation_id":"4fd9715a-7dda-45ce-8a63-e2764a9c28a3","resolution":{"observed_at":"2026-08-06T12:55:46.678765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.410566Z","title":"Spatio-temporal context prompting for zero-shot action detection","venue":null,"work_id":"8374b454-9148-4297-bec4-bb67ac0fef65","year":2025},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.390618Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:bcb6f74034f69d4528969b368ff82826ab0b168f0f367e8db616d83f7f02cdb2","observation_id":"6a36ac45-cfb3-456a-ac98-2a8c50b20fbd","resolution":{"observed_at":"2026-08-06T12:55:46.474804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:38.531397Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.531397Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:141cb47fdcac691519ea195180bd36cd8783c6a2bcb87fe901d30439921233c1","observation_id":"0b32c2b8-056c-47cf-ac57-d1f5024f7549","resolution":{"observed_at":"2026-08-06T12:55:38.531397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.163979Z","title":"Region-aware pretraining for open- vocabulary object detection with vision transformers","venue":null,"work_id":"a1229fb0-84dd-47dc-ac3d-25eca73257c6","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.641284Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:301a4b00675ed04c93a1685cf2df501e2747e51c69027fb0e538c89ac8905ba5","observation_id":"5bbc9bb6-f8f0-4f41-bc00-37147d0d2d25","resolution":{"observed_at":"2026-08-06T12:55:46.257650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.926657Z","title":"On feature normalization and data augmentation","venue":null,"work_id":"be6964c7-dd9f-45b8-9698-7dc1103abc42","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.754542Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:0ce2dbd00abcbe4f07b7cb800d3853616c5b49fc92b02bd25fae5b201d8d293d","observation_id":"69262b86-ce9e-44f5-8156-17915e2b7ea9","resolution":{"observed_at":"2026-08-06T12:55:46.032460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.654891Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"ef55d279-c5c7-4b4f-b1c7-1acaa9f7aa86","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.881211Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:92280601c20a7a786abcda79e5ba720014e13cd329a66ca79d64bc9346aa19f6","observation_id":"27a371b8-107f-4dbc-b820-05748e87c9ce","resolution":{"observed_at":"2026-08-06T12:55:45.806299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:38.992416Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.992416Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:c7aee172a4a96d16ef616276211598d979358e2767e64319bbab58e07e47f2f1","observation_id":"96be9944-1086-4730-a0c1-ae2ec5354e4f","resolution":{"observed_at":"2026-08-06T12:55:38.992416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14843","last_updated":"2022-11-27T14:47:31Z","snapshot_observed_at":"2026-08-06T03:25:36.980355Z","submitted_at":"2022-11-27T14:47:31Z","title":"Learning Object-Language Alignments for Open-Vocabulary Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14843","snapshot_observed_at":"2026-08-06T12:55:39.145776Z","title":"Learning object-language alignments for open-vocabulary object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.145776Z"},"links":{"cited_paper":"/paper/2211.14843","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:11a273158af37c4e6831ea96a2d17a91ce08af4c78079f4849e4a67b868cf4f6","observation_id":"0f55c61e-cd19-4f48-a533-c1f51e3fd8ab","resolution":{"observed_at":"2026-08-06T12:55:39.145776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-06T12:55:39.270857Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.270857Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:82639825a077938482e98375d157f9537519202223b250f1f14b855ad9c304d2","observation_id":"af6a9cf9-bbff-42cd-8e17-e1b110e90cce","resolution":{"observed_at":"2026-08-06T12:55:39.270857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.425398Z","title":"Moma: Multi-object multi-actor activity parsing","venue":null,"work_id":"9c31b088-be94-4569-aadd-14388d3cefaf","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.376277Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:f0cee7fdc006045e400e1af9c292d0f34c77b78a75199b2137fa1011fbab2871","observation_id":"c71580c9-2a89-4a71-bd0b-32a618059631","resolution":{"observed_at":"2026-08-06T12:55:45.534123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:39.478935Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.478935Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:3325ca27cfc50df22c6c87d793953b1c47f11c3bbedb8fd0110975e84e85cabc","observation_id":"f39fccbd-82bb-4898-96f7-bd52d3dc0bbf","resolution":{"observed_at":"2026-08-06T12:55:39.478935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.166223Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f7a6f7f7-a01e-4c75-bbd1-86d0eba55052","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.630606Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:574c01088195e70744d111cca1b86265e87070f92cd547c809f13ad1f291b464","observation_id":"81659a12-2f1c-4cb7-98ec-2f0e983214af","resolution":{"observed_at":"2026-08-06T12:55:45.265455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.983427Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"257b61e4-d864-4dd6-a9d0-1e2ebae22867","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.727853Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:d776936c9aec8440584294b7e05a460c1358465fe33da0eb7415e4e4482745c0","observation_id":"228b6ebe-8c05-44ea-9c66-b84aab72939c","resolution":{"observed_at":"2026-08-06T12:55:45.081638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.765821Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"aee67657-dee0-4517-906b-45739b1f837d","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.848204Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:ca75cd106983f282cf3f6192c39261f1a95a688f2799fbaaf85a2ea51dc259ed","observation_id":"c5aa8eb1-7c74-400e-815e-eb4541b7dc87","resolution":{"observed_at":"2026-08-06T12:55:44.837052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.553939Z","title":"Feature adaptation with clip for few-shot classification","venue":null,"work_id":"572aac4e-7539-4397-9bf6-f0622df0735c","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.955529Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:64dd11ef73017448d74e53aad9582ff499f3932a3362b9acdda505af2228e193","observation_id":"742852c3-85d0-42b1-a66e-8bb309ec9bde","resolution":{"observed_at":"2026-08-06T12:55:44.655749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.325196Z","title":"Cora: Adapting clip for open- vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"40345e0d-4d42-41a6-b1a4-6c35d5fdfab2","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.070428Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:98f92b86d462ba649fb6af37fc9175e6f88d29fef87f92f265b7d95481730959","observation_id":"f6f3f7f4-705c-4f09-99ec-ec3291c07080","resolution":{"observed_at":"2026-08-06T12:55:44.410536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T12:55:40.226378Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.226378Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:a3cc5e2a252db0d4eefae2f7c043b2f1b3b69d8586cc820d5958b29437963497","observation_id":"90e63cc7-bf95-4ea5-aa75-fa1289e5b836","resolution":{"observed_at":"2026-08-06T12:55:40.226378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04979","last_updated":"2023-03-15T06:48:23Z","snapshot_observed_at":"2026-08-06T00:46:55.995575Z","submitted_at":"2022-12-09T16:39:09Z","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04979","snapshot_observed_at":"2026-08-06T12:55:40.391207Z","title":"Videococa: Video-text modeling with zero-shot transfer from contrastive captioners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.391207Z"},"links":{"cited_paper":"/paper/2212.04979","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:579b6f52472449618ec8afcaedb1ec71dce384e3c962cdcc51ac22770646f083","observation_id":"be5f889f-9d9e-4c31-bc0c-d8ab0347161f","resolution":{"observed_at":"2026-08-06T12:55:40.391207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.111180Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning","venue":null,"work_id":"4cb74d15-636c-4b3b-94b9-2b781ba6ca91","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.486806Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:d97705fa1d2a21d99546089c6bf0f0dc7b158a0c08d399c8976b4ea49ef0ab68","observation_id":"a435b824-26a2-43b8-ab32-aa11018d5207","resolution":{"observed_at":"2026-08-06T12:55:44.192366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08610","last_updated":"2023-11-05T11:00:23Z","snapshot_observed_at":"2026-08-06T17:01:43.530949Z","submitted_at":"2022-04-19T02:05:56Z","title":"Image Data Augmentation for Deep Learning: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08610","snapshot_observed_at":"2026-08-06T12:55:40.626249Z","title":"Image data augmentation for deep learning: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.626249Z"},"links":{"cited_paper":"/paper/2204.08610","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:36d263dfcce7f6304d27f3ebef2c529a207260537bdfe35895f0257ea410ece2","observation_id":"c0d2707b-60cc-43ad-ac3a-837849da7257","resolution":{"observed_at":"2026-08-06T12:55:40.626249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.910838Z","title":"Textmania: Enriching visual feature by text-driven manifold augmentation","venue":null,"work_id":"26348a77-38a9-4dea-941e-ad808c30f153","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.747236Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:10c6bf1f8ba3db07aa92c8f23401861246f82d1dd91ff4755f9b513980f1f073","observation_id":"1dfee674-368b-4c65-a70e-9e3d971d1b73","resolution":{"observed_at":"2026-08-06T12:55:44.008802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T12:55:40.853210Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.853210Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:7946cf90930b6d96b2597626d6972d55c931e45fecdbb4f39e5b1286f284ea3f","observation_id":"029b2d6d-5e9d-45b5-aa3e-3c75799d9622","resolution":{"observed_at":"2026-08-06T12:55:40.853210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.679654Z","title":"Cutmix: Regularization strategy to train strong classifiers with local- izable features","venue":null,"work_id":"f0421497-c31f-4ed8-b39d-9e42558ce842","year":2019},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.973725Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:102f2c3c195c365294b2dc67a0d25e6d3ec6a8a9dc8aec7adb78a214fc8e7c49","observation_id":"f9b956d0-0445-4635-96b6-4c7a73d489f2","resolution":{"observed_at":"2026-08-06T12:55:43.803420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.474883Z","title":"Fasa: Feature augmentation and sampling adaptation for long-tailed instance segmentation","venue":null,"work_id":"2295b52e-91d7-4e9c-8fcf-74c56e53c1b1","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.106384Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:ef644e96afd9bb91489c4498e9e9253a3172400a673f99f75d349bda061c8c18","observation_id":"67fffa54-4971-474c-8cf5-517ee3aec1ce","resolution":{"observed_at":"2026-08-06T12:55:43.561454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.266681Z","title":"Open- vocabulary object detection using captions","venue":null,"work_id":"25115fc9-7300-4ac2-a76e-97120772bae0","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.202202Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:344b2ad05d19a709d86c55cae87d989cdcc9200c34b8753633b512b36520acea","observation_id":"3778ec90-35a5-4105-af86-eea23753776b","resolution":{"observed_at":"2026-08-06T12:55:43.357916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.084646Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"a6674bc4-4c2f-4ad1-9108-b4e1d02fe231","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.316739Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:09b2936c327adc1bc96e1591cc0deb4e39282991d53e4508440f32110263e5b5","observation_id":"f06c7f30-fcb4-4a29-84aa-7b381c0b3191","resolution":{"observed_at":"2026-08-06T12:55:43.153849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-07-31T03:05:21.352948Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-06T12:55:41.440158Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.440158Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:c434eef30bc0e3ce146edd70a7415adefe23d51ce1a060275f310478ada6ea04","observation_id":"894229cf-580e-40d6-bde8-c47c77ae6cb1","resolution":{"observed_at":"2026-08-06T12:55:41.440158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09506","last_updated":"2024-03-25T02:45:35Z","snapshot_observed_at":"2026-08-07T22:01:10.581203Z","submitted_at":"2024-03-14T15:53:04Z","title":"Don't Judge by the Look: Towards Motion Coherent Video Representation","version":2},"cited_work":{"arxiv_id":"2403.09506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09506","snapshot_observed_at":"2026-08-06T12:55:42.035329Z","title":"Don't Judge by the Look: Towards Motion Coherent Video Representation","venue":"cs.CV","work_id":"0a67c418-d91f-4312-addd-cee8ac503614","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.609971Z"},"links":{"cited_paper":"/paper/2403.09506","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:ded91714256def8a58bbb2a95e5d8e61af2d48d1c363399061902eec3f7229b8","observation_id":"5fead464-266c-48d7-bad9-279b38e5a680","resolution":{"observed_at":"2026-08-06T12:55:42.090764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:42.861617Z","title":"Regionclip: Region- based language-image pretraining","venue":null,"work_id":"e3b7b92f-2b9f-484c-b8b0-73fe89470af4","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.733634Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:81122ff737a86e048172f1a5290e5819cd25a773a26ee677c55362e48f58b880","observation_id":"ee2b1069-a638-46dd-8642-57333de3b69e","resolution":{"observed_at":"2026-08-06T12:55:42.975241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:42.609863Z","title":"Not all features matter: Enhancing few-shot clip with adaptive prior refine- ment","venue":null,"work_id":"f1f8dc67-c95c-41a0-b9a4-67955fa38799","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.858385Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:c2b8d992a8b76c05c401ff076bb15db3ccd98638f8893d99268e4ac14a227bce","observation_id":"15a2ed48-d5a7-425b-9651-0d15ca654883","resolution":{"observed_at":"2026-08-06T12:55:42.726408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T07:17:06.405378Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2507.21353."}