Arsip Tag: AI Memory

Training Data Inclusion 2026: Mengapa Brand di Training Data LLM Memiliki Keunggulan 2.8x di ChatGPT

Brand yang muncul di training data LLM 2.8x lebih sering dikutip ChatGPT. Pelajari strategi masuk ke training data ChatGPT, Gemini, dan Perplexity.

Bayangkan Anda membangun konten terbaik di industri Anda. Artikel Anda informatif, mendalam, dan penuh data orisinal. Namun ketika pengguna bertanya kepada ChatGPT tentang kategori Anda, brand Anda tidak muncul. Mengapa? Karena ChatGPT tidak “mengingat” brand Anda dari training data. Ini bukan tentang kualitas konten—ini tentang inclusion dalam training data LLM.

Data dari berbagai penelitian menunjukkan bahwa brand yang muncul di training data LLM memiliki keunggulan signifikan. Analisis GEO Brand Citation Index menemukan bahwa brand dengan citations di ChatGPT (training data) memiliki 2.8x lebih banyak sitasi dibandingkan brand yang hanya muncul di live retrieval . Ini adalah keunggulan yang sangat besar—dan tidak bisa dikejar hanya dengan konten fresh.

Penelitian Wellows menganalisis 20.5 juta sitasi AI dan menemukan bahwa 90.4% halaman yang dikutip adalah ghost citations—tidak menyebut brand apapun. Hanya 4.5% sitasi yang berasal dari halaman brand sendiri . Ini berarti sebagian besar konten yang dikutip adalah konten “netral” dari Wikipedia, Reddit, dan media—bukan dari brand itu sendiri.

Artikel ini akan membahas apa itu training data, mengapa inclusion dalam training data begitu penting, sumber training data yang paling berpengaruh, dan strategi untuk masuk ke training data LLM.

Apa Itu Training Data dan Mengapa Penting?

Dataset yang Digunakan untuk Melatih LLM

Training data adalah dataset raksasa yang digunakan untuk melatih model bahasa besar (LLM) seperti ChatGPT, Gemini, dan Claude. Dataset ini mencakup miliaran dokumen dari berbagai sumber:

  • Wikipedia (47.9% sumber ChatGPT)

  • Media corpus (The New York Times, BBC, Reuters, dll.)

  • Reddit dan forum online

  • Academic papers (.edu domain)

  • Books dan publikasi

  • Websites (crawled dari web)

Ketika sebuah brand muncul dalam training data, model AI “mengingat” brand tersebut. Ini menciptakan AI Memory advantage—brand tersebut menjadi bagian dari pengetahuan dasar AI, bukan sekadar sumber yang di-retrieve secara real-time.

Perbedaan Training Data vs Live Retrieval

Aspek Training Data Live Retrieval
Sumber Dataset yang sudah tetap Web yang berubah terus
Waktu Training time Inference time
Kecepatan Instant (sudah dalam model) Perlu dicari
Konsistensi Stabil Volatil
Keunggulan AI Memory (default answer) Freshness (konten terbaru)

Brand yang muncul di training data memiliki default advantage—AI akan menyebut brand Anda secara default bahkan sebelum melakukan retrieval. Ini adalah keunggulan yang sangat besar.

Mengapa Training Data Inclusion Penting

1. Default Answer Advantage

Brand yang muncul di training data menjadi bagian dari “default answer” AI. Ketika pengguna bertanya tentang kategori Anda, AI akan menyebut brand Anda secara otomatis—tanpa perlu mencari di web.

2. Stabilitas Jangka Panjang

Training data tidak berubah sesering live retrieval. Brand yang masuk training data akan tetap “diingat” AI untuk waktu yang lama—bahkan jika konten Anda tidak diperbarui.

3. Keunggulan 2.8x di ChatGPT

GEO Brand Citation Index menemukan bahwa brand dengan citations di ChatGPT (training data) memiliki 2.8x lebih banyak sitasi dibandingkan brand yang hanya muncul di live retrieval . Ini adalah keunggulan yang sangat besar.

4. Ghost Citations Prevention

Ketika brand Anda muncul di training data, AI lebih mungkin menyebutkan brand Anda (bukan hanya konten Anda) dalam jawaban. Ini mengurangi ghost citations—di mana AI menggunakan konten Anda tanpa brand mention.

Sumber Training Data yang Paling Penting

1. Wikipedia (47.9% Sumber ChatGPT)

Wikipedia adalah sumber paling sering dikutip ChatGPT, mencakup 47.9% dari top cited sources . Wikipedia sangat penting untuk training data karena:

  • Konten ditinjau dan diedit oleh komunitas

  • Sumber-sumber yang dikutip terverifikasi

  • Konsistensi entitas tinggi

  • Format terstruktur dengan infobox, referensi, dan kategori

Strategi: Dapatkan halaman Wikipedia untuk brand Anda, atau setidaknya mention di halaman Wikipedia yang relevan.

2. Reddit (21% Sitasi AI)

Reddit menyumbang 21% sitasi AI dan merupakan sumber training data yang sangat penting . Reddit penting karena:

  • Diskusi autentik dari pengguna nyata

  • Upvotes dan downvotes memberikan sinyal kualitas

  • Format Q&A yang terstruktur

  • Beragam topik dan perspektif

Strategi: Bangun partisipasi autentik di subreddit yang relevan. Jawaban yang mendapat banyak upvotes lebih mungkin masuk training data.

3. Media Corpus (The New York Times, BBC, Reuters, dll.)

Media tier-1 adalah sumber training data yang sangat penting. Dataset pelatihan LLM mencakup miliaran artikel dari media di seluruh dunia.

Strategi: Dapatkan liputan di media tier-1 yang sering digunakan dalam training data (Forbes, WSJ, TechCrunch, Kompas, Detik, dll.).

4. Academic Papers (.edu Domain)

Academic papers dari .edu domain adalah sumber training data yang sangat dipercaya. LLM dilatih pada jutaan paper dari arXiv, PubMed, dan repository akademis lainnya.

Strategi: Publikasikan paper akademis atau white paper yang dikutip oleh akademisi. Jika memungkinkan, publikasikan di jurnal yang terindeks.

5. Books dan Publikasi

Books adalah sumber training data yang penting, terutama untuk deep knowledge. Dataset pelatihan LLM mencakup jutaan buku dari berbagai penerbit.

Strategi: Publikasikan buku atau eBook yang relevan dengan industri Anda. Pastikan buku tersebut terindeks di platform yang digunakan untuk training data.

Strategi Masuk Training Data LLM

1. Dapatkan Halaman Wikipedia

Ini adalah langkah paling penting untuk training data inclusion. Wikipedia adalah sumber #1 untuk training data ChatGPT (47.9%). Jika brand Anda memiliki halaman Wikipedia, Anda secara otomatis masuk ke training data.

Apa yang harus dilakukan:

  • Pastikan brand Anda memenuhi kriteria notability Wikipedia

  • Tulis draft halaman Wikipedia yang netral dan terverifikasi

  • Ajukan ke komunitas Wikipedia untuk review

  • Pertahankan halaman dengan update berkala

Jika halaman Wikipedia belum memungkinkan:

  • Dapatkan mention di halaman Wikipedia yang relevan

  • Pastikan brand Anda disebut di artikel Wikipedia tentang kategori Anda

2. Dapatkan Mention di Media Tier-1

Media tier-1 adalah sumber training data terbesar kedua setelah Wikipedia. The New York Times, BBC, Reuters, Forbes, WSJ, dan media global lainnya digunakan secara luas dalam training data.

Apa yang harus dilakukan:

  • Targetkan media tier-1 yang relevan dengan industri Anda

  • Tawarkan data orisinal dan expert commentary

  • Publikasikan opini dan thought leadership

  • Bangun hubungan jangka panjang dengan jurnalis

Untuk Indonesia:

  • Targetkan Kompas, Detik, Tirto, Tempo, CNN Indonesia

  • Media ini sering muncul dalam training data untuk konteks Indonesia

3. Aktif di Reddit dengan Jawaban Autentik

Reddit adalah sumber training data yang sangat penting (21% sitasi AI). Jawaban Reddit yang mendapat banyak upvotes sering masuk ke training data.

Apa yang harus dilakukan:

  • Bergabung dengan subreddit yang relevan dengan industri Anda

  • Berikan jawaban yang detail, autentik, dan membantu

  • Jangan promosi langsung—fokus pada memberikan nilai

  • Jawaban dengan banyak upvotes lebih mungkin masuk training data

  • Konsisten: jawab pertanyaan secara teratur selama bertahun-tahun

4. Publikasikan Original Research yang Dikutip Media

Original research adalah magnet untuk earned media—dan earned media adalah pintu masuk ke training data.

Apa yang harus dilakukan:

  • Lakukan survei tahunan dan publikasikan hasilnya

  • Analisis data internal dan bagikan insight industri

  • Publikasikan benchmark industri

  • Tawarkan data eksklusif kepada jurnalis terpilih

  • Setiap liputan media = data point di training data

5. Dapatkan Recognition dari Gartner/Forrester

Untuk B2B, Gartner dan Forrester adalah sumber training data yang sangat penting. Laporan Magic Quadrant dan Wave sering dikutip dalam training data.

Apa yang harus dilakukan:

  • Daftar untuk evaluasi di Gartner Magic Quadrant atau Forrester Wave

  • Bangun hubungan dengan analis Gartner/Forrester

  • Kumpulkan data dan case studies untuk mendukung evaluasi

  • Jika belum masuk, targetkan Gartner Peer Insights

6. Publikasikan Buku atau eBook

Books adalah sumber training data yang penting. Buku yang diterbitkan oleh penerbit ternama lebih mungkin masuk training data.

Apa yang harus dilakukan:

  • Publikasikan buku tentang industri atau keahlian Anda

  • Pastikan buku terdaftar di ISBN dan platform buku

  • Promosikan buku untuk mendapatkan ulasan dan mentions

  • Buku yang banyak dibaca lebih mungkin masuk training data

7. Pantau Training Data Inclusion

Anda tidak bisa meningkatkan apa yang tidak Anda ukur.

Metrik yang harus dilacak:

  • Wikipedia presence: Apakah brand Anda memiliki halaman Wikipedia atau disebut di Wikipedia?

  • Media tier-1 mentions: Berapa banyak media tier-1 yang menyebut brand Anda?

  • Reddit mentions: Berapa banyak diskusi di Reddit yang menyebut brand Anda?

  • Gartner/Forrester presence: Apakah brand Anda disebut di laporan analis?

  • ChatGPT citations: Apakah brand Anda muncul di ChatGPT untuk prompt relevan?

Kesimpulan: Training Data Inclusion sebagai AI Memory Advantage

Brand yang muncul di training data LLM memiliki keunggulan 2.8x lebih banyak sitasi di ChatGPT. Wikipedia adalah sumber #1 (47.9%), diikuti oleh Reddit (21%) dan media tier-1. 90.4% halaman yang dikutip adalah ghost citations—hanya 4.5% dari brand sendiri.

Langkah yang bisa Anda ambil hari ini:

  1. Audit training data presence Anda: Apakah brand Anda muncul di Wikipedia? Reddit? Media tier-1?

  2. Targetkan halaman Wikipedia: Ini adalah langkah paling penting

  3. Dapatkan mention di media tier-1: Forbes, WSJ, TechCrunch, Kompas, Detik

  4. Aktif di Reddit: Berikan jawaban autentik yang mendapat upvotes

  5. Publikasikan original research: Data orisinal adalah hook untuk earned media

  6. Targetkan Gartner/Forrester recognition: Untuk B2B, ini sangat penting

  7. Pantau ChatGPT citations: Lacak apakah brand Anda muncul di ChatGPT

Di era AI search, training data inclusion adalah AI Memory advantage yang tidak bisa dikejar hanya dengan konten fresh. Brand yang masuk training data akan menjadi “default answer” AI. Brand yang tidak masuk training data akan selalu bergantung pada live retrieval—yang volatile dan kompetitif.

AI Memory vs Live Search 2026: Memahami Archetype Brand di ChatGPT dan Perplexity

Pelajari lima archetype brand di AI search: Dominant, AI Memory, Live Search, Consensus GEO, dan Ghost. Strategi brand untuk memenangkan ChatGPT dan Perplexity.

Pertanyaan yang sama, platform yang berbeda, hasil yang sangat berbeda. Brand Anda mungkin menjadi sumber utama di ChatGPT tetapi sama sekali tidak terlihat di Perplexity. Atau sebaliknya—Anda mendominasi Perplexity tetapi tidak pernah disebutkan di ChatGPT. Ini bukanlah kebetulan. Ini adalah cerminan dari archetype brand yang berbeda di AI search.

Kevin Indig menganalisis 3.981 domain, 115 prompts, dan 14 negara di empat platform AI utama dan menemukan bahwa hampir tidak ada overlap antara brand yang dikutip ChatGPT dan brand yang disebut Gemini untuk prompt yang sama . Perbedaan ini bukan hanya tentang platform—ini tentang bagaimana AI engine melihat brand Anda.

GEO Brand Citation Index telah mengkategorikan brand ke dalam lima archetype berdasarkan performa mereka di ChatGPT (yang sangat bergantung pada training data) vs Perplexity (yang sangat bergantung pada live web) . Memahami archetype brand Anda adalah langkah pertama untuk mengembangkan strategi GEO yang efektif.

Artikel ini akan membahas lima archetype brand di AI search, perbedaan antara AI Memory dan Live Search, cara mengukur delta antara ChatGPT dan Perplexity, dan strategi untuk setiap archetype.

Lima Archetype Brand di AI Search

Berdasarkan analisis terhadap ribuan brand di berbagai industri, berikut adalah lima archetype yang muncul :

1. Dominant (Penguasa)

Karakteristik: Dikutip secara konsisten di semua platform AI—ChatGPT, Perplexity, Gemini, dan AI Overviews. Brand ini adalah category owners—nama mereka identik dengan kategorinya.

Ciri-ciri:

  • High ChatGPT citations (tertanam dalam training data)

  • High Perplexity citations (muncul di live web search)

  • High Gemini mentions (dikenali sebagai entity)

  • High AI Overviews citations (dikutip di ringkasan Google)

Contoh: Nike di Fashion, Ahrefs di SEO, Salesforce di CRM.

Strategi:

  • Pertahankan dengan freshness cycle 60 hari

  • Perluas ke kategori terkait untuk pertumbuhan

  • Pantau competitive citation gap secara aktif

2. AI Memory (Ingatan AI)

Karakteristik: Brand ini memiliki citations tinggi di ChatGPT tetapi citations rendah di Perplexity. Ini berarti AI “mengingat” brand Anda dari training data, tetapi tidak “menemukan” Anda di web saat ini.

Ciri-ciri:

  • High ChatGPT citations (tertanam dalam training data)

  • Low Perplexity citations (tidak muncul di live web)

Delta: Negatif (ChatGPT > Perplexity)

Mengapa ini terjadi: Brand Anda mungkin populer di masa lalu, memiliki banyak mentions di Wikipedia atau media legacy, tetapi tidak aktif membangun konten fresh dan earned media saat ini. AI masih “mengingat” Anda dari training data, tetapi sistem retrieval live tidak menemukan Anda.

Risiko: Seiring waktu, training data menjadi usang dan brand Anda menghilang dari ChatGPT juga.

Strategi:

  • Bangun konten fresh yang dapat di-retrieve oleh Perplexity

  • Earned media untuk muncul di web saat ini

  • Original research untuk menciptakan data baru yang tidak dimiliki kompetitor

  • Video di YouTube untuk membangun live citation infrastructure

3. Live Search (Pencarian Langsung)

Karakteristik: Brand ini memiliki citations rendah di ChatGPT tetapi citations tinggi di Perplexity. Ini berarti AI “menemukan” Anda di web saat ini, tetapi belum “mengingat” Anda dari training data.

Ciri-ciri:

  • Low ChatGPT citations (tidak tertanam dalam training data)

  • High Perplexity citations (muncul di live web search)

Delta: Positif (Perplexity > ChatGPT)

Mengapa ini terjadi: Brand Anda mungkin baru, aktif membangun konten dan earned media, tetapi belum cukup lama atau cukup dikenal untuk masuk ke training data LLM.

Peluang: Anda dapat memenangkan visibility di Perplexity dan AI Overviews (yang bergantung pada live web) sambil secara bertahap membangun entitas Anda untuk masuk ke training data ChatGPT.

Strategi:

  • Perkuat entity strength: Wikidata, Knowledge Panel, konsistensi data

  • Targetkan earned media di sumber yang dipercaya AI (Wikipedia, Reddit, media tier-1)

  • Original research untuk menciptakan data yang akan masuk ke training data

  • Pantau perkembangan ChatGPT citations seiring waktu

4. Consensus GEO (Konsensus GEO)

Karakteristik: Brand ini memiliki citations moderat di semua platform—tidak dominan di mana pun, tetapi hadir di mana-mana.

Ciri-ciri:

  • Moderate ChatGPT citations

  • Moderate Perplexity citations

  • Moderate Gemini mentions

  • Moderate AI Overviews citations

Delta: Mendekati nol (seimbang)

Mengapa ini terjadi: Brand Anda memiliki presence yang solid di berbagai platform, tetapi tidak unggul di satu pun. Ini bisa menjadi posisi yang nyaman—Anda terlihat di mana-mana—tetapi juga berisiko karena Anda tidak menjadi “default answer” di mana pun.

Strategi:

  • Pilih satu platform untuk didominasi: Jangan mencoba menjadi yang terbaik di semua platform

  • Fokus pada core category: Depth membangun otoritas

  • Tingkatkan evidence density: Angka, data, statistik untuk meningkatkan citation rate

  • Bangun third-party validation: 85% mentions berasal dari third-party

5. Ghost (Hantu)

Karakteristik: Brand ini pernah dikutip secara historis tetapi hampir absen di semua platform AI saat ini. Ini adalah brand yang “menghilang” dari AI search.

Ciri-ciri:

  • Low ChatGPT citations

  • Low Perplexity citations

  • Low Gemini mentions

  • Low AI Overviews citations

Delta: Tidak relevan (tidak cukup citations untuk diukur)

Mengapa ini terjadi: Brand Anda mungkin memiliki citations historis yang baik, tetapi tidak mempertahankan presence di era AI search. Content tidak di-refresh, earned media berhenti, entity strength melemah.

Risiko: Brand Anda menjadi tidak terlihat sama sekali di AI search—dan karena 54.6% pencarian dijawab langsung oleh AI, brand Anda kehilangan sebagian besar audiens potensial.

Strategi:

  • Mulai dari nol: Bangun entity strength dari dasar

  • Original research untuk menciptakan data orisinal

  • Earned media: Dapatkan mention di platform yang dipercaya AI

  • Video di YouTube untuk membangun citation infrastructure

  • Freshness cycle: Konten baru dan refresh konten lama

  • Pantau perkembangan citations secara berkala

Mengukur Delta ChatGPT-Perplexity

Delta adalah perbedaan antara ChatGPT citations dan Perplexity citations. Ini mengungkapkan apakah brand Anda adalah AI Memory (delta negatif) atau Live Search (delta positif).

Formula Delta

text
Delta = ChatGPT Citations - Perplexity Citations

Interpretasi:

  • Delta positif besar: Brand Anda adalah Live Search—terlihat di web saat ini tetapi belum masuk training data ChatGPT

  • Delta negatif besar: Brand Anda adalah AI Memory—tertanam dalam training data tetapi tidak terlihat di web saat ini

  • Delta mendekati nol: Brand Anda adalah Consensus GEO—seimbang di semua platform

Contoh Delta dari GEO Brand Citation Index

GEO Brand Citation Index mencatat beberapa brand dengan delta yang signifikan :

Brand ChatGPT Citations Perplexity Citations Delta Archetype
Claude 150 200 +50.12 Live Search
[Brand A] 180 45 -135 AI Memory
[Brand B] 95 88 -7 Consensus GEO

Claude memiliki delta +50.12—ini berarti Claude jauh lebih kuat di Perplexity (live search) daripada di ChatGPT (training data) . Claude adalah brand yang relatif baru dan aktif membangun earned media, tetapi belum cukup mapan di training data LLM.

Mengapa Delta Penting?

Delta mengungkapkan di mana Anda harus berinvestasi:

  • Delta negatif (AI Memory): Investasi di earned media, konten fresh, dan live web presence

  • Delta positif (Live Search): Investasi di entity strength, konsistensi data, dan membangun presence yang akan masuk ke training data berikutnya

Strategi Brand Berdasarkan Archetype

Untuk AI Memory (Delta Negatif)

Prioritas: Pindahkan brand Anda dari training data ke live web.

  1. Konten fresh: Publikasikan konten baru secara teratur—AI retrieval membutuhkan freshness

  2. Earned media: Dapatkan mention di platform yang dipercaya Perplexity (YouTube, Reddit, Wikipedia)

  3. Original research: Data orisinal yang tidak dimiliki kompetitor

  4. Video infrastructure: Bangun YouTube presence dengan transkrip yang dioptimasi

  5. Freshness cycle 60 hari: Refresh konten yang sudah ada

Untuk Live Search (Delta Positif)

Prioritas: Pindahkan brand Anda dari live web ke training data ChatGPT.

  1. Entity strength: Wikidata Q-number, Knowledge Panel, konsistensi data

  2. Konsistensi di seluruh web: Nama, deskripsi, positioning yang sama di semua platform

  3. Third-party mentions: Wikipedia adalah sumber paling sering dikutip ChatGPT (47.9%)

  4. Original research: Data orisinal akan masuk ke training data

  5. Pantau: ChatGPT citations seiring waktu—targetkan pertumbuhan

Untuk Consensus GEO (Delta Mendekati Nol)

Prioritas: Pilih satu platform untuk didominasi.

  1. Pilih platform: Di mana audiens Anda paling aktif? ChatGPT? Perplexity? Gemini?

  2. Fokuskan sumber daya: Jangan mencoba menjadi yang terbaik di semua platform

  3. Depth > Breadth: Bangun otoritas di core category Anda

Untuk Ghost (Citations Rendah di Semua Platform)

Prioritas: Mulai dari dasar.

  1. Entity strength: Wikidata, Knowledge Panel, schema markup, konsistensi data

  2. Original research: Data orisinal—ini adalah “unfair advantage”

  3. Earned media: Dapatkan mention di platform yang dipercaya AI

  4. Video: YouTube presence dengan transkrip yang dioptimasi

  5. Pantau: Lacak citations secara berkala—targetkan growth

Kesimpulan: Memahami Archetype adalah Langkah Pertama Strategi GEO

Lima archetype brand di AI search—Dominant, AI Memory, Live Search, Consensus GEO, dan Ghost—mengungkapkan bagaimana AI engine melihat brand Anda berdasarkan kombinasi training data (ChatGPT) dan live web (Perplexity).

Memahami archetype Anda adalah langkah pertama untuk mengembangkan strategi GEO yang efektif. Tanpa memahami archetype Anda, Anda tidak tahu di mana harus berinvestasi:

  • AI Memory: Investasi di live web presence (earned media, konten fresh, video)

  • Live Search: Investasi di entity strength (Wikidata, Knowledge Panel, konsistensi data)

  • Consensus GEO: Pilih satu platform untuk didominasi

  • Ghost: Mulai dari dasar dengan entity strength dan original research

Langkah yang bisa Anda ambil hari ini:

  1. Ukur ChatGPT citations Anda untuk prompt relevan di kategori Anda

  2. Ukur Perplexity citations Anda untuk prompt yang sama

  3. Hitung delta: ChatGPT citations – Perplexity citations

  4. Identifikasi archetype Anda: Dominant, AI Memory, Live Search, Consensus GEO, atau Ghost

  5. Terapkan strategi sesuai archetype: Investasi di area yang paling lemah

  6. Pantau secara berkala: Archetype dapat berubah seiring waktu

GEO Brand Citation Index menekankan: “Understanding your archetype is the first step to developing an effective GEO strategy” . Brand yang memahami archetype mereka akan mengalokasikan sumber daya dengan bijak. Brand yang tidak memahami archetype mereka akan membuang anggaran pada strategi yang tidak efektif.