feat(livia): Research-PoC — drei reale Zürcher Quellen live

Livia liest jetzt tatsächlich aus dem Netz statt aus Mockdaten. Ein Knopf
«Research aktualisieren» ruft serverseitig drei Quellen ab, beurteilt die
Einträge in einem einzigen LLM-Aufruf und zeigt nur an, was plausibel zu
Flächenbedarf oder Flächenfreisetzung führen könnte.

Kein Crawler, kein Scheduler, keine Queue, keine Datenbank. Der Hoster kann
bereits serverlose Funktionen — es hat bisher nur niemand eine gebraucht.
Deshalb genügt eine einzige Datei unter `api/`, drei Abruffunktionen, eine
Normalisierung und ein Analyseaufruf.

Quellen, alle drei live geprüft:
- Zürcher Handelskammer, 10 Artikel
- Greater Zurich Area, 9 Artikel
- Zefix / Open Data Kanton Zürich, CSV direkt

Zur Zefix-Quelle eine Feststellung, die von der Aufgabenstellung abweicht: die
CSV enthält keine Firmennamen. Sie führt Tageszahlen von Neugründungen je
NOGA-Branche für den Kanton Zürich. Daraus lässt sich kein Unternehmenslead
bauen, sondern nur ein aggregiertes Frühsignal zum Zielmarkt — und genau so
wird es übergeben. Namen zu erfinden, um das erwartete Format zu treffen, wäre
die eine Sache, die Livia nie tun darf.

Die drei Quellen stehen im Frontend unter «Angebundene Kanäle & Systeme» mit
Status und anklickbarem Originallink; jeder erzeugte Lead verlinkt zusätzlich
die Seite, aus der er stammt. Die Adressen kommen aus derselben Liste, die der
Abruf benutzt — der angezeigte Link kann damit nicht von dem abweichen, was
tatsächlich gelesen wurde.

Der Textextraktor sucht den Artikeltext im engsten passenden Container. Ohne
das standen bei der Handelskammer Telefonnummern und Öffnungszeiten am Anfang
jedes Textes, und das Modell hätte die Fusszeile mitbeurteilt.

Der LLM-Schlüssel liegt ausschliesslich serverseitig in `ANTHROPIC_API_KEY`.
Fehlt er, sagt die Oberfläche offen, dass gelesen, aber nicht beurteilt wurde —
statt eine leere Liste als «nichts gefunden» auszugeben.

Für die lokale Entwicklung mountet ein Vite-Plugin dieselbe Handler-Datei, die
Vercel in der Produktion ausliefert; es gibt keine zweite Fassung des
Endpoints. `tsconfig.api.json` nimmt `api/` in `tsc -b` auf, damit ein
Tippfehler dort nicht erst beim Deployment auffällt.

Geprüft: tsc 0 Fehler, eslint 0 Fehler/0 Warnungen, 423/423 Tests grün, Build
erfolgreich, Live-Lauf im Browser mit 20 real gelesenen Einträgen aus 3/3
Quellen ohne Laufzeitfehler. Die LLM-Beurteilung selbst ist mangels Schlüssel
noch ungetestet.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
Benjamin SutterandClaude Opus 5 committed 2026-08-30 14:23:35 +02:00
1 parent 37b6270f50
commit 2a0ba287f6
16 files changed
+1509 -31

No files matched your search

+153
View File
@@ -0,0 +1,153 @@
/**
* Livia Research-PoC — die Beurteilung der gelesenen Einträge.
*
* Ein einziger Aufruf für alle Einträge statt einer Anfrage je Artikel (§22).
* Das hält Laufzeit und Kosten klein und gibt dem Modell zugleich den
* Gesamtblick, den es für die Einordnung «relevant oder nicht» braucht.
*
* Der Schlüssel steht ausschliesslich serverseitig in `ANTHROPIC_API_KEY` —
* diese Datei läuft in der serverlosen Funktion und landet nie im Bundle (§10).
*/
import Anthropic from '@anthropic-ai/sdk'
import { z } from 'zod'
import type { ResearchItem } from './researchSources'
import type { ResearchLead } from '../../src/domain/researchLead'
/**
* Der Beurteilungsauftrag (§12).
*
* Bewusst kurz. Zwei Sätze tragen die eigentliche Arbeit: der Relevanzbegriff
* und das Verbot, etwas hinzuzuerfinden. Alles Weitere wäre Ausschmückung, die
* das Modell eher zu geschmeidigen als zu belegten Antworten verleitet.
*/
const SYSTEM_PROMPT = `Du bist Livia, Research & Market Intelligence Agent für professionelle Schweizer Gewerbeimmobilien-Bewirtschaftungen.
Analysiere die bereitgestellten Unternehmensmeldungen.
Relevant sind nur Entwicklungen, die plausibel zu zusätzlichem Gewerbeflächenbedarf, einem neuen Standort, einer Standortveränderung, Flächenreduktion oder zukünftiger Wiedervermietung führen könnten.
Allgemeine Unternehmensnachrichten ohne plausiblen Immobilienbezug sind IRRELEVANT.
Bewerte konservativ. Erfinde keine Informationen, die nicht in der Quelle stehen. Wenn eine Meldung keinen Firmennamen nennt, schreibe in "company" das, was die Quelle tatsächlich benennt — erfinde keinen Namen.
Antworte ausschliesslich mit einem JSON-Objekt der Form:
{"results":[{"index":0,"company":"...","eventType":"EXPANSION","headline":"...","location":"...","summary":"...","relevance":"high","confidence":0.8,"reason":"...","recommendedAction":"..."}]}
Gib für JEDEN Eingabeeintrag genau ein Ergebnis mit dem passenden "index" zurück.
eventType ist einer von: EXPANSION, NEW_LOCATION, HEADCOUNT_GROWTH, INVESTMENT, M_AND_A, RESTRUCTURING, SITE_CLOSURE, NEW_COMPANY, IRRELEVANT.
relevance ist "high", "medium" oder "low". confidence ist eine Zahl zwischen 0 und 1.
Deutsch, Schweizer Rechtschreibung (ss statt ß). Keine langen Analysen.`
const AnalysisSchema = z.object({
results: z.array(z.object({
index: z.number().int().min(0),
company: z.string().min(1),
eventType: z.enum([
'EXPANSION', 'NEW_LOCATION', 'HEADCOUNT_GROWTH', 'INVESTMENT',
'M_AND_A', 'RESTRUCTURING', 'SITE_CLOSURE', 'NEW_COMPANY', 'IRRELEVANT',
]),
headline: z.string().min(1),
location: z.string().optional(),
summary: z.string().min(1),
relevance: z.enum(['high', 'medium', 'low']),
confidence: z.number().min(0).max(1),
reason: z.string().min(1),
recommendedAction: z.string().optional(),
})),
})
export interface AnalysisOutcome {
leads: ResearchLead[]
/** Einträge ohne plausiblen Immobilienbezug. */
discarded: number
/** Beobachtungswürdig, aber ohne bestätigten Flächenbezug. */
watchlist: number
}
/** Das erste JSON-Objekt aus der Antwort — falls das Modell doch etwas drumherum schreibt. */
function extractJson(text: string): unknown {
const trimmed = text.trim()
const start = trimmed.indexOf('{')
const end = trimmed.lastIndexOf('}')
if (start === -1 || end <= start) throw new Error('Antwort enthält kein JSON-Objekt')
return JSON.parse(trimmed.slice(start, end + 1))
}
export async function analyzeResearchItems(items: ResearchItem[]): Promise<AnalysisOutcome> {
if (items.length === 0) return { leads: [], discarded: 0, watchlist: 0 }
const apiKey = process.env.ANTHROPIC_API_KEY
if (!apiKey) {
throw new Error(
'ANTHROPIC_API_KEY ist serverseitig nicht gesetzt — ohne Schlüssel findet keine Beurteilung statt.',
)
}
const client = new Anthropic({ apiKey })
const eingabe = items
.map((it, i) => [
`### Eintrag ${i}`,
`Quelle: ${it.source}`,
`Titel: ${it.title}`,
it.publishedAt ? `Publiziert: ${it.publishedAt}` : '',
`Text: ${it.text.slice(0, 2000)}`,
].filter(Boolean).join('\n'))
.join('\n\n')
const response = await client.messages.create({
model: 'claude-opus-5',
max_tokens: 16000,
system: SYSTEM_PROMPT,
// Einordnen ist eine Routineaufgabe — niedrige Stufe spart Zeit und Kosten,
// ohne das Modell zu wechseln.
output_config: { effort: 'low' },
messages: [{ role: 'user', content: eingabe }],
})
if (response.stop_reason === 'refusal') {
throw new Error('Die Beurteilung wurde vom Modell abgelehnt.')
}
const text = response.content
.filter((b): b is Anthropic.TextBlock => b.type === 'text')
.map(b => b.text)
.join('')
const parsed = AnalysisSchema.parse(extractJson(text))
const leads: ResearchLead[] = []
let discarded = 0
let watchlist = 0
for (const r of parsed.results) {
const item = items[r.index]
if (!item) continue
if (r.eventType === 'IRRELEVANT') { discarded += 1; continue }
if (r.relevance === 'low') { watchlist += 1; continue }
leads.push({
company: r.company,
eventType: r.eventType,
headline: r.headline,
location: r.location,
summary: r.summary,
relevance: r.relevance,
confidence: r.confidence,
reason: r.reason,
recommendedAction: r.recommendedAction,
source: item.source,
sourceUrl: item.url,
publishedAt: item.publishedAt,
})
}
// Stärkste Einordnung zuerst — die Liste soll oben beginnen, wo gehandelt wird.
leads.sort((a, b) =>
(a.relevance === b.relevance ? b.confidence - a.confidence : a.relevance === 'high' ? -1 : 1))
return { leads, discarded, watchlist }
}
+262
View File
@@ -0,0 +1,262 @@
/**
* Livia Research-PoC — die drei realen Quellen.
*
* Bewusst drei einzelne Funktionen statt einer Connector-Abstraktion: es sind
* drei Quellen, und jede liest anders. Eine gemeinsame Schnittstelle würde
* hier nur die Unterschiede verstecken, die man beim Debuggen braucht.
*
* Kein Browser, kein Playwright, kein Scheduler — nur `fetch()` und ein
* HTML-Parser. Fällt eine Quelle aus, liefert sie einen Fehler und die anderen
* beiden laufen weiter (§21).
*/
import * as cheerio from 'cheerio'
import { RESEARCH_SOURCES } from '../../src/lib/researchSources'
/** Gemeinsames Minimalformat aller Quellen (§9). */
export interface ResearchItem {
source: string
title: string
url: string
text: string
publishedAt?: string
}
/**
* Die Adressen kommen aus `src/lib/researchSources.ts` — derselben Liste, die
* die Oberfläche unter «Angebundene Kanäle & Systeme» anzeigt. Damit kann der
* angezeigte Link nicht von dem abweichen, was tatsächlich abgerufen wird.
*/
export const SOURCES = RESEARCH_SOURCES
/** Höchstzahl Artikel je Newsquelle — hält Laufzeit und Tokenverbrauch klein (§22). */
const MAX_ARTICLES = 10
const FETCH_TIMEOUT_MS = 15_000
const UA = 'Mozilla/5.0 (compatible; PropertyMatch-LiviaResearch/1.0; +https://property-match-virid.vercel.app)'
async function getText(url: string, extraHeaders: Record<string, string> = {}): Promise<string> {
const ctrl = new AbortController()
const timer = setTimeout(() => ctrl.abort(), FETCH_TIMEOUT_MS)
try {
const res = await fetch(url, {
headers: { 'User-Agent': UA, 'Accept-Language': 'de-CH,de;q=0.9', ...extraHeaders },
redirect: 'follow',
signal: ctrl.signal,
})
if (!res.ok) throw new Error(`HTTP ${res.status}`)
return await res.text()
} finally {
clearTimeout(timer)
}
}
/**
* Container, in denen der Artikeltext bevorzugt gesucht wird — von eng nach weit.
*
* Die Reihenfolge ist der Unterschied zwischen brauchbarem und unbrauchbarem
* Input: Nimmt man gleich alle `<p>` der Seite, stehen bei der Handelskammer
* zuerst Telefonnummern, Öffnungszeiten und Spam-geschützte Mailadressen im
* Text — und das Modell beurteilt dann die Fusszeile mit.
*/
const ARTICLE_CONTAINERS = ['.news-single', '.news-detail', 'article', 'main']
/** Zeilen, die erkennbar Kontaktangaben statt Inhalt sind. */
const BOILERPLATE = /(dont-like-spam|ich-will-kein-spam|^\+41|Montag\s*[–-]\s*Freitag)/i
/**
* Haupttext einer Artikelseite.
*
* Absichtlich grob: Skripte und Navigation raus, Absätze aus dem engsten
* passenden Container einsammeln, kürzen. Für die Beurteilung genügen die
* ersten Absätze — ein vollwertiger Lesemodus wäre für einen
* Machbarkeitsnachweis Aufwand ohne zusätzliche Aussage.
*/
function extractArticleText(html: string): string {
const $ = cheerio.load(html)
$('script, style, nav, header, footer, noscript, form').remove()
const sammle = (selector: string): string[] => {
const parts: string[] = []
$(selector).each((_, el) => {
const t = $(el).text().replace(/\s+/g, ' ').trim()
if (t.length > 40 && !BOILERPLATE.test(t)) parts.push(t)
})
return parts
}
for (const container of ARTICLE_CONTAINERS) {
if ($(container).length === 0) continue
const parts = sammle(`${container} p`)
const text = parts.join('\n')
if (text.length > 200) return text.slice(0, 2500)
}
return sammle('p').join('\n').slice(0, 2500)
}
function absolute(href: string, base: string): string {
try {
return new URL(href, base).toString()
} catch {
return href
}
}
/** Quelle A — Zürcher Handelskammer, Unternehmensmeldungen aus der Region (§4). */
export async function fetchZhkResearch(): Promise<ResearchItem[]> {
const listHtml = await getText(SOURCES.ZHK.url)
const $ = cheerio.load(listHtml)
const links: { url: string; title: string }[] = []
const seen = new Set<string>()
$('a[href*="/de/wirtschaft-und-politik/news/"]').each((_, el) => {
const href = $(el).attr('href')
if (!href) return
const url = absolute(href, SOURCES.ZHK.url)
if (seen.has(url)) return
seen.add(url)
const title = $(el).text().replace(/\s+/g, ' ').trim()
links.push({ url, title })
})
const chosen = links.slice(0, MAX_ARTICLES)
const items: ResearchItem[] = []
for (const l of chosen) {
try {
const html = await getText(l.url)
const $a = cheerio.load(html)
const title = l.title || $a('h1').first().text().replace(/\s+/g, ' ').trim()
const published =
$a('time').first().attr('datetime') ||
$a('meta[property="article:published_time"]').attr('content') ||
undefined
items.push({
source: SOURCES.ZHK.name,
title,
url: l.url,
text: extractArticleText(html),
publishedAt: published,
})
} catch {
// Ein einzelner Artikel darf den Lauf nicht kippen.
}
}
return items
}
/** Quelle B — Greater Zurich Area, Ansiedlungen und Markteintritte (§5). */
export async function fetchGreaterZurichResearch(): Promise<ResearchItem[]> {
const listHtml = await getText(SOURCES.GZA.url)
const $ = cheerio.load(listHtml)
const links: { url: string; title: string }[] = []
const seen = new Set<string>()
$('a[href*="/de/news/"]').each((_, el) => {
const href = $(el).attr('href')
if (!href) return
const url = absolute(href, SOURCES.GZA.url)
if (seen.has(url) || /\/de\/news\/?$/.test(url)) return
seen.add(url)
links.push({ url, title: $(el).text().replace(/\s+/g, ' ').trim() })
})
const chosen = links.slice(0, MAX_ARTICLES)
const items: ResearchItem[] = []
for (const l of chosen) {
try {
const html = await getText(l.url)
const $a = cheerio.load(html)
const title = l.title || $a('h1').first().text().replace(/\s+/g, ' ').trim()
items.push({
source: SOURCES.GZA.name,
title,
url: l.url,
text: extractArticleText(html),
publishedAt:
$a('time').first().attr('datetime') ||
$a('meta[property="article:published_time"]').attr('content') ||
undefined,
})
} catch {
// siehe oben
}
}
return items
}
/**
* Quelle C — Zefix / Open Data Kanton Zürich, direkt als CSV (§6).
*
* **Wichtige Feststellung zur Datenlage:** Die Datei enthält keine Firmennamen.
* Sie führt Tageszahlen von Neugründungen je NOGA-Branche für den Kanton
* Zürich — Spalten `br_abschnitt_desc, br_abschnitt_code, wirtschaftssektor_desc,
* wirtschaftssektor_code, location, date, value`.
*
* Daraus lässt sich deshalb kein Unternehmenslead bauen, sondern nur ein
* aggregiertes Frühsignal zum Zielmarkt. Genau so wird es weitergegeben.
* Firmennamen zu erfinden, um das erwartete Format zu treffen, wäre die eine
* Sache, die Livia nie tun darf.
*/
export async function fetchZefixResearch(): Promise<ResearchItem[]> {
const csv = await getText(SOURCES.ZEFIX.url)
const lines = csv.split(/\r?\n/)
if (lines.length < 2) throw new Error('CSV enthält keine Daten')
// Die Beschreibung kann Kommas enthalten — die sechs Pflichtfelder stehen
// deshalb von hinten, der Rest davor ist die Branchenbezeichnung.
interface Row { branche: string; datum: string; anzahl: number }
const rows: Row[] = []
let neuestesDatum = ''
for (let i = 1; i < lines.length; i++) {
const line = lines[i]
if (!line) continue
const parts = line.split(',')
if (parts.length < 7) continue
const anzahl = Number(parts[parts.length - 1])
const datum = parts[parts.length - 2]
const ort = parts[parts.length - 3]
const branche = parts.slice(0, parts.length - 6).join(',').trim()
if (ort !== 'ZH' || !Number.isFinite(anzahl)) continue
if (datum > neuestesDatum) neuestesDatum = datum
rows.push({ branche, datum, anzahl })
}
if (!neuestesDatum) throw new Error('Keine Zürcher Datenzeilen gefunden')
// Fenster: die letzten 30 Tage vor dem jüngsten Datum im Bestand.
const bis = new Date(neuestesDatum)
const von = new Date(bis.getTime() - 30 * 24 * 60 * 60 * 1000)
const vonIso = von.toISOString().slice(0, 10)
const jeBranche = new Map<string, number>()
let gesamt = 0
for (const r of rows) {
if (r.datum < vonIso || r.datum > neuestesDatum) continue
if (r.branche === 'Alle Branchen') continue
if (r.anzahl <= 0) continue
jeBranche.set(r.branche, (jeBranche.get(r.branche) ?? 0) + r.anzahl)
gesamt += r.anzahl
}
const top = [...jeBranche.entries()].sort((a, b) => b[1] - a[1]).slice(0, 8)
if (top.length === 0) throw new Error('Keine Neugründungen im Auswertungsfenster')
const text = [
`Amtliche Statistik des Kantons Zürich zu Handelsregister-Neugründungen.`,
`Auswertungsfenster ${vonIso} bis ${neuestesDatum}: insgesamt ${gesamt} Neugründungen im Kanton Zürich.`,
`Verteilung nach Branche:`,
...top.map(([b, n]) => `- ${b}: ${n}`),
``,
`Hinweis zur Datenart: Der Datensatz enthält ausschliesslich Tageszahlen je Branche.`,
`Firmennamen, Adressen und Gemeinden sind darin nicht enthalten.`,
].join('\n')
return [{
source: SOURCES.ZEFIX.name,
title: `Kanton Zürich: ${gesamt} Handelsregister-Neugründungen in 30 Tagen`,
url: SOURCES.ZEFIX.url,
text,
publishedAt: neuestesDatum,
}]
}
+107
View File
@@ -0,0 +1,107 @@
/**
* Livia Research-PoC — der eine serverseitige Endpoint (§20).
*
* POST /api/livia/research/refresh
*
* Ruft die drei Quellen ab, normalisiert, beurteilt einmal per LLM und gibt
* die relevanten Leads zurück. Kein Scheduler, keine Queue, keine Datenbank —
* der Lauf beginnt und endet mit dieser Anfrage.
*
* Läuft als serverlose Funktion auf derselben Vercel-Instanz, die schon die
* Anwendung ausliefert. Das ist der Grund, warum für den PoC gar keine neue
* Infrastruktur nötig war: der Hoster kann bereits Serverfunktionen, es hat
* bisher nur niemand eine gebraucht.
*/
import type { IncomingMessage, ServerResponse } from 'node:http'
import {
SOURCES,
fetchZhkResearch,
fetchGreaterZurichResearch,
fetchZefixResearch,
} from '../../_lib/researchSources'
import type { ResearchItem } from '../../_lib/researchSources'
import { analyzeResearchItems } from '../../_lib/researchAnalysis'
import type { ResearchRefreshResult, ResearchSourceResult } from '../../../src/domain/researchLead'
interface Quelle {
id: string
name: string
url: string
laden: () => Promise<ResearchItem[]>
}
const QUELLEN: Quelle[] = [
{ ...SOURCES.ZHK, laden: fetchZhkResearch },
{ ...SOURCES.GZA, laden: fetchGreaterZurichResearch },
{ ...SOURCES.ZEFIX, laden: fetchZefixResearch },
]
export default async function handler(req: IncomingMessage, res: ServerResponse): Promise<void> {
res.setHeader('Content-Type', 'application/json; charset=utf-8')
// Ein Live-Lauf soll nie aus einem Zwischenspeicher beantwortet werden.
res.setHeader('Cache-Control', 'no-store')
if (req.method !== 'POST') {
res.statusCode = 405
res.end(JSON.stringify({ error: 'Nur POST' }))
return
}
// Alle drei parallel: eine langsame Quelle soll die beiden anderen nicht aufhalten.
const ergebnisse = await Promise.all(
QUELLEN.map(async (q): Promise<{ meta: ResearchSourceResult; items: ResearchItem[] }> => {
try {
const items = await q.laden()
return {
meta: { id: q.id, name: q.name, url: q.url, ok: true, itemCount: items.length },
items,
}
} catch (err) {
// Eine kaputte Quelle darf die Demo nicht zerstören (§21).
return {
meta: {
id: q.id, name: q.name, url: q.url, ok: false, itemCount: 0,
error: err instanceof Error ? err.message : 'Unbekannter Fehler',
},
items: [],
}
}
}),
)
const sources = ergebnisse.map(e => e.meta)
const items = ergebnisse.flatMap(e => e.items)
const basis: ResearchRefreshResult = {
sources,
analyzed: items.length,
discarded: 0,
watchlist: 0,
leads: [],
refreshedAt: new Date().toISOString(),
}
if (items.length === 0) {
res.statusCode = 200
res.end(JSON.stringify({
...basis,
analysisError: 'Keine der drei Quellen lieferte Einträge.',
}))
return
}
try {
const { leads, discarded, watchlist } = await analyzeResearchItems(items)
res.statusCode = 200
res.end(JSON.stringify({ ...basis, leads, discarded, watchlist }))
} catch (err) {
// Gelesen wurde trotzdem — das sagen wir offen, statt eine leere Liste als
// «nichts gefunden» auszugeben.
res.statusCode = 200
res.end(JSON.stringify({
...basis,
analysisError: err instanceof Error ? err.message : 'Die Beurteilung schlug fehl.',
}))
}
}