---
name: ai-prasowka-2-3-zdania-link-tagi
category: research
description: >-
  Researcher AI newsów — pobiera i syntezuje artykuły o AI/GenAI/LLM
  dla firmy IT. Format: **Tytuł** (tłum. niefizolany), 3–4 zdania
  streszczenia (synteza domenowa), link, #tagi. Obsługuje web search,
  ekstrakcję artykułów i formatowanie wyjścia do Rocket.Chat / lokalnego
  pliku.
version: 1.0.0
related_skills:
  - rss-pressreview
  - rss-ai-pressreview
notes:
  - Skill wywoływany przez cron 5e3ecb0e1501 (pn-pt 9:00 Warsaw).
  - Agent nie scrapuje RSS — używa web_search + web_extract.
  - Streszczenie ma być syntezą, nie tłumaczeniem dosłownym.
---

# AI Prasówka — Researcher Newsów AI

Skill dla firmy IT: automatycznie zbiera i syntezuje najnowsze artykuły
o AI, GenAI, LLM, agentic AI i wdrożeniach enterprise. Gotowe streszczenia
w formacie gotowym do publikacji na kanale / czacie / pliku.

---

## 1. Wyszukiwanie artykułów

### 1.1 Źródła i frazy wyszukiwania

Używaj `web_search` z następującymi frazami (rotuj, mieszaj):

```
AI enterprise news today
generative AI latest news
LLM large language model news
AI agents tool use news
AI governance regulation latest
openai anthropic google AI news
AI deployment production enterprise
RAG retrieval augmented generation news
AI safety alignment news
```

**Parametry:**
- `limit=5` na frazę (max 10 fraz = 50 wyników surowych)
- Filtrowaj duplikaty po domenie + tytule (Levenshtein > 0.8 = duplikat)
- Priorytet: artykuły z ostatnich 24h > 48h > starsze

### 1.2 Wybór artykułów

Z listy wyników wybierz **4–6 artykułów** do ekstrakcji na podstawie:

| Priorytet | Kryterium |
|-----------|-----------|
| 🔴 Wysoki | Nowy model, release, benchmark, regulacja, wdrożenie enterprise |
| 🟡 Średni | Badania, porównania, analizy trendów |
| 🟢 Niski | Opinie, komentarze bez nowych danych |

**Odrzucaj:**
- Artykuły typu "best deal", "coupon", "unboxing"
- Recenzje sprzętu (telefon, laptop, TV)
- Clickbait bez treści merytorycznej
- Artykuły premium/paywall bez możliwości ekstrakcji (zaznacz w outputcie)

---

## 2. Ekstrakcja i czytanie artykułów

### 2.1 Ekstrakcja treści

Dla każdego wybranego artykułu użyj `web_extract`:

```python
# Ekstrakcja max 5 artykułów naraz (limit narzędzia)
result = web_extract(urls=[url1, url2, url3, url4, url5])
```

### 2.2 Ocena jakości ekstrakcji

| Status | Akcja |
|--------|-------|
| ✅ Treść > 500 słów | Kontynuuj syntezę |
| ⚠️ Treść 200–500 słów | Użyj jako bazy, uzupełnij web_search snippetami |
| ❌ Treść < 200 słów | Użyj tylko tytułu + snippetu z web_search |
| ❌ Błąd ekstrakcji | Oznacz jako "[brak treści — paywall/błąd]" |

---

## 3. Synteza streszczeń — KLUCZOWA ZASADA

> **Streszczenie ma być SYNTETYCZNE, nie dosłownym tłumaczeniem.**
> Author reads the article, understands the core concept within its domain
> (AI/IT/enterprise), and rewrites the takeaway from scratch in Polish,
> focusing on what matters for an IT company.

### 3.1 Proces syntezy

Dla każdego artykułu:

1. **Przeczytaj treść** — zrozum kontekst, nie tylko tytuł
2. **Zidentyfikuj rdzeń** — co jest kluczowe? Jaka zmiana/nowość/kierunek?
3. **Osadź w domenie IT** — co to znaczy dla firmy IT? Dla wdrożeń? Dla klientów?
4. **Napisz po polsku od nowa** — nie tłumacz zdanie po zdaniu
5. **Dodaj praktyczny wniosek** — dlaczego to ważne, co z tym zrobić

### 3.2 Struktura streszczenia (3–4 zdania)

```
Zdanie 1: Co się wydarzyło / jaki jest kierunek?
           (konkretna informacja, nie ogólnik)
Zdanie 2: Dlaczego to ważne / kontekst?
           (implikacje, porównanie, trend)
Zdanie 3: Co to oznacza dla IT / enterprise?
           (praktyczne wdrożenie, ryzyko, szansa)
Zdanie 4: (opcjonalnie) Przykład, liczba, kolejny krok
```

### 3.3 Zasady języka

- **Polski**, konwersacyjny ton (jak na Slacku / czacie zespołu)
- **Nie zaczynaj od** "Artykuł mówi o…" / "Tekst opisuje…" / "Według artykułu…"
- **Nie tłumacz dosłownie** tytułów angielskich — przetłumacz sens
- **Unikaj anglicyzmów** tam gdzie są polskie odpowiedniki:
  - ❌ "fine-tuning" → ✅ "dostrajanie"
  - ❌ "deployment" → ✅ "wdrożenie"
  - ❌ "benchmark" → ✅ "testy porównawcze" (ale "benchmark" jest OK w kontekście IT)
- **Nie dodawaj** informacji których nie ma w artykule
- **Nie zgaduj** liczb, dat, cen — jeśli brak danych, pomiń

### 3.4 Przykłady dobrej syntezy

**Źródło (EN):**
> "OpenAI announces GPT-5 with 2M token context window, native tool use, and enterprise SSO. Pricing starts at $0.06/1K tokens for input."

**❌ Złe (dosłowne tłumaczenie):**
> OpenAI ogłasza GPT-5 z oknem kontekstowym 2 milionów tokenów, natywnym użyciem narzędzi i SSO enterprise. Cena zaczyna się od $0.06/1K tokenów za wejście.

**✅ Dobre (synteza domenowa):**
> OpenAI wypuściło GPT-5 z kontekstem 2M tokenów — to 4× więcej niż dotychczasowe modele, co otwiera scenariusze przetwarzania całych baz kodowych w jednym zapytaniu. Natywne tool use eliminuje potrzebę zewnętrznych orchestratorów agentów, co przyspiesza wdrożenia w enterprise. Cena wejścia ($0.06/1K) jest konkurencyjna — warto sprawdzić opłacalność względem modeli open-source na large batche.

---

## 4. Format wyjścia

### 4.1 Pojedynczy artykuł

```
**Tytuł kierunku po polsku — krótko, bez nawiasów**

3–4 zdania streszczenia (synteza domenowa, patrz §3).

🔗 https://domain.com/original-url
#ai #genai #llm #enterprise #wdrozenia
```

### 4.2 Zasady tytułu

- **Bold** (`**...**`), NAGŁÓWEK Markdown
- **Bez nawiasów** — unikaj `(AI)`, `(GenAI)`, `(LLM)` w tytule
- **Po polsku** — tłumaczenie sensu, nie słów
- **5–10 słów** — max
- **Bez punktacji końcowej**

**Przykłady:**
- ✅ `**Claude 4 z kontekstem miliona tokenów**`
- ✅ `**UE finalizuje AI Act — kary od Q3 2026**`
- ❌ `**Nowy model AI od Anthropic (CLAUDE-4) z długim kontekstem**`

### 4.3 Link

- Format: `🔗 https://domain.com/article` (z emoji 🔗)
- Używaj ORYGINALNEGO URL (nie kanonicznego dedup)
- Nie dodawaj parametrów trackingowych (utm_*, gclid, itp.)

### 4.4 Tagi

Wybierz **5–8 tagów** z taxonomy:

| Tag | Kiedy używać |
|-----|-------------|
| `#ai` | Ogólnie o AI |
| `#genai` | Generatywne AI, LLM |
| `#llm` | Modele językowe |
| `#agenci` / `#agenticAI` | Agenci, tool use, MCP |
| `#enterprise` / `#wdrozenia` | Wdrożenia enterprise, adopcja |
| `#privacy` / `#governance` / `#compliance` | Polityka, regulacje, GDPR, safety |
| `#API` / `#integracje` / `#RAG` | Integracje techniczne, RAG |
| `#evaluation` / `#benchmark` | Testy, porównania modeli |
| `#mlops` | Infrastruktura ML, trening, deployment |
| `#safety` / `#alignment` | Bezpieczeństwo AI |
| `#synthetic-data` | Dane syntetyczne |
| `#open-source` | Modele/ narzędzia open-source |

Tagi dobieraj na podstawie **treści artykułu**, nie tylko źródła.

---

## 5. Batch output — format końcowy

### 5.1 Nagłówek batcha

```
📰 Prasówka AI — YYYY-MM-DD

```

### 5.2 Separatory

Pomiędzy artykułami: pusta linia (bez `---`).

### 5.3 Limit batcha

- **4–6 artykułów** na batch
- Całość < 4000 znaków (dla Rocket.Chat)
- Jeśli więcej niż 6 — podziel na kolejne batche

### 5.4 Przykład kompletnego batcha

```
📰 Prasówka AI — 2026-05-01

**OpenAI udostępnia GPT-5 z natywnym tool use**
GPT-5 wprowadza natywne wywoływanie narzędzi, co eliminuje warstwę
orchestracji w agentach i upraszcza architektury enterprise. Kontekst
2M tokenów pozwala na przetwarzanie pełnych baz kodowych w jednym zapytaniu.
Cena wejścia $0.06/1K jest konkurencyjna względem modeli open-source.
🔗 https://techcrunch.com/2026/05/01/gpt-5-tool-use
#ai #genai #llm #agenci #enterprise

**Anthropic publikuje benchmarki Claude 4 vs konkurencja**
Nowe benchmarki Anthropic pokazują, że Claude 4 przewyższa GPT-4o
w zadaniach reasoningowych o 12%, ale traci w generowaniu kodu.
Dla firm oceniających dostawców AI — warto sprawdzić wyniki na swoich
realnych taskach, a nie tylko na publicznych testach.
🔗 https://anthropic.com/blog/claude-4-benchmarks
#ai #llm #evaluation #benchmark

**Google Cloud dodaje RAG pipeline do Vertex AI**
Vertex AI zyskuje wbudowany RAG pipeline z native embeddings i wektorem
bazą danych. To przyspiesza wdrożenia enterprise bez potrzeby budowania
customowej infrastruktury retrieval.
🔗 https://cloud.google.com/blog/vertex-ai-rag
#ai #RAG #integracje #enterprise #wdrozenia
```

---

## 6. Implementacja (skrypt)

### 6.1 Struktura przepływu

```
1. web_search × 8-10 fraz (§1.1)
2. Deduplikacja wyników (domena + tytuł)
3. Ocena priorytetów (§1.2) → wybierz 4-6
4. web_extract artykułów (§2.1)
5. Dla każdego artykułu:
   a. Przeanalizuj treść
   b. Zidentyfikuj rdzeń (§3.1)
   c. Napisz syntezę po polsku (§3.2-3.3)
   d. Dobierz tagi (§4.4)
   e. Sformatuj wyjście (§4.1-4.4)
6. Złóż batch (§5)
7. Zapisz do pliku / wyślij
```

### 6.2 Output do zapisu

Wynik zapisuj do:
- **Lokalnie:** `~/.hermes/cron/output/ai-prasowka-YYYY-MM-DD.md`
- **Rocket.Chat:** via webhook (patrz rss-pressreview §5)

### 6.3 Obsługa błędów

| Problem | Akcja |
|---------|-------|
| Brak wyników z web_search | Zmień frazy, spróbuj po angielsku |
| Wszystkie ekstrakcje Failed | Użyj tylko snippetów z web_search + title |
| Za mało artykułów (< 3) | Rozszerz okno czasowe do 48h |
| Token limit przekroczony | Skróć streszczenia do 2 zdań |

---

## 7. Pitfalli

- **Nie tłumacz dosłownie** —to najczęstszy błąd. Czytaj artykuł, rozumij,
  pisz od nowa po polsku.
- **Nie dodawaj informacji spoza artykułu** — jeśli nie ma liczb, nie zgaduj.
- **Unikaj "Artykuł mówi o..."** — zaczynaj od konkretu.
- **Sprawdzaj daty** — artykuł sprzed tygodnia nie jest "najnowszy".
- **Nie klikaj w paywalle** — jeśli web_extract zwraca mało treści, oznacz
  "[brak pełnej treści]" i przejdź dalej.
- **Tagi z treści, nie ze źródła** — artykuł o RAG na stronie OpenAI
  dostaje `#RAG`, nie `#openai` jako główny tag.
- **Limit 4000 znaków** — Rocket.Chat odrzuca dłuższe wiadomości.
  Podziel na batche jeśli trzeba.

---

## 8. Cron integration

Skill jest wywoływany przez cron job:
- **Job ID:** `5e3ecb0e1501`
- **Schedule:** `0 9 * * 1-5` (pn-pt 9:00 Warsaw)
- **Deliver:** local (do `~/.hermes/cron/output/`)
- **Model:** `openai/gpt-5.4-nano` via openrouter
- **Toolsets:** web, terminal, execute_code

Prompt crona kieruje agenta do:
1. Wyszukania artykułów AI (web_search)
2. Ekstrakcji treści (web_extract)
3. Syntezy streszczeń (web_extract + LLM)
4. Formatowania batcha (§5)
5. Zapisu do pliku lokalnego
